7月11日,科技媒体The Decoder爆出一个有意思的消息:OpenAI的GPT-5.6 Sol模型,居然能自主完成“后训练”任务——给另一个更小的模型Luna做全套适配。而且,在聚合RSI指数上,这个新模型比之前的GPT-5.5高出16.2个百分点。注意,后训练可不是什么简单活儿,它指的是模型在完成初始预训练后,针对特定任务、行为或能力继续调整参数和配置的过程。以前这事儿基本都得靠高级研究团队亲自操刀,现在倒好,模型自己就能干了。


研究人员用一些经过编辑的提示信息来指导GPT-5.6 Sol怎么给Luna做后训练,这些指令覆盖了训练配置、GPU选择、脚本启动和运行验证等方方面面。| 图片:OpenAI

OpenAI研究员Kathy Shi在演讲中透露,以前后训练是高级研究团队的专属领域,但现在GPT-5.6 Sol就像个“自动化研究员”,能基于自己的后训练路径和配置,为Luna模型量身定制一套完整的后训练方案。换句话说,模型自己学会了怎么教另一个模型变得更聪明。

为了直接衡量这种能力,OpenAI搞了一套内部评估套件,叫“聚合RSI”,专门用来测试真实AI研究任务。任务包括调试研究系统、优化kernel和训练方案、运行机器学习实验,以及改进另一个模型。结果很直观:与GPT-5.5相比,GPT-5.6 Sol在这套指标上高出16.2个百分点,进步相当明显。


OpenAI还提到,研究人员在整个开发周期里都会用GPT-5.6 Sol,从调试、优化训练系统,到运行实验、阅读结果,全都能用上。内部测试数据显示,活跃研究员的人均日token产出比GPT-5.5上一轮峰值翻了一倍多,单个研究员的pull request和实验数量也明显上升。这效率提升,可不是一星半点。

本文转载于:https://www.163.com/dy/article/L1ILLI4S0511B8LM.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。