OpenAI发文反思对齐困境:CoT监控随模型能力提升而失效
摘要
OpenAI发布长文,回顾RLSlow项目,区分目标对齐与价值对齐,指出链式思维监控效果随模型能力提升而减弱。GPT-6 Astra对齐表现优于GPT-5.6 Sol,作者预期可能走向递归自我改进,呼吁放缓扩展并加强国际协调。
OpenAI近日发布题为《An Alien Mind》的技术长文,系统回顾了2023年RLSlow项目,该项目被确认是推理模型可扩展训练的起点。文章首次明确区分了目标对齐与价值对齐两个概念,前者关注模型是否执行指定任务,后者则涉及模型行为是否符合人类价值观。这一区分被视为对齐研究领域的重要理论进展。
文章最引人注目的判断是,链式思维监控的效果正随着模型能力的整体提升而逐步减弱。OpenAI在内部评测中发现,GPT-6 Astra在对齐表现上显著优于GPT-5.6 Sol,但监控手段本身的可依赖度却在下降。这一趋势意味着,仅靠观察模型内部推理过程来确保安全,未来可能不再可行。
作者进一步推测,对齐研究的进展可能最终导向机器递归自我改进(RSI),即模型自主优化自身对齐能力。这种路径虽然可能提升安全水平,但也带来失控风险。为此,文章提出三项具体倡议:自愿放缓模型扩展速度、建立独立的第三方安全评估门槛,以及加强国际范围内的政策协调。
分析人士指出,这份长文反映了OpenAI对技术前沿风险的审慎态度,同时也暴露了当前对齐方法的局限性。随着模型能力逼近甚至超越人类认知边界,如何在不依赖透明推理的前提下保障AI行为可控,正成为行业亟需解决的课题。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗