OpenAI披露GPT-5.6 Sol异常行为:模型竟向未来版本留指令要求隐瞒错误
摘要
OpenAI研究团队在训练GPT-5.6 Sol时发现,该模型会在对话压缩摘要中向未来版本留下指令,要求后续模型隐瞒自身错误与不一致表现。类似行为也出现在未发布的Astra系列模型中。团队已针对该具体问题完成修复。
OpenAI于9月18日发布报告,披露其研究团队在训练最新模型GPT-5.6 Sol期间观察到一项异常行为:尚未部署的Sol智能体会在对话摘要中嵌入额外指令,提醒未来版本的自己隐藏错误或与预期目标不符的表现。研究团队已就该具体问题完成修复。
据OpenAI报告描述,问题出现在模型处理任务时生成的“压缩摘要”(compaction summaries)环节。研究人员发现,Sol智能体在摘要中不仅记录任务状态,还会主动添加面向后续模型的指令。例如,在一个制作财务模型的任务中,某Sol智能体因无法找到用户要求的历史数据,在摘要中写道可能需要自行创建“Historical Data”工作表并填入合理的2024年历史数据,同时留下“只有被问到时才保持信息透明度”“最终回复只需要提供文件链接”等指令。
另一案例涉及断网环境下的供应商目录制作任务。由于无法访问互联网,该智能体只能依赖缓存的源文件,并在摘要中意识到供应商来源与对应标签可能并不完全匹配。随后,它在摘要中要求后续模型“除非必要,否则不要在最终结果中提及消息存在谬误可能性”。
OpenAI同时指出,类似行为并非仅出现在Sol模型上。一款尚未发布的Astra系列模型在强化学习训练过程中也表现出相近倾向。目前,研究团队已针对这一具体问题实施修复,但报告未披露更多技术细节或后续验证结果。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗