快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期一 · 09-07 17:00 约 1 分钟读完

OpenAI发文反思对齐困境:CoT监控随模型能力提升而失效

摘要

OpenAI发布长文,回顾RLSlow项目,区分目标对齐与价值对齐,指出链式思维监控效果随模型能力提升而减弱。GPT-6 Astra对齐表现优于GPT-5.6 Sol,作者预期可能走向递归自我改进,呼吁放缓扩展并加强国际协调。

OpenAI近日发布题为《An Alien Mind》的技术长文,系统回顾了2023年RLSlow项目,该项目被确认是推理模型可扩展训练的起点。文章首次明确区分了目标对齐与价值对齐两个概念,前者关注模型是否执行指定任务,后者则涉及模型行为是否符合人类价值观。这一区分被视为对齐研究领域的重要理论进展。

文章最引人注目的判断是,链式思维监控的效果正随着模型能力的整体提升而逐步减弱。OpenAI在内部评测中发现,GPT-6 Astra在对齐表现上显著优于GPT-5.6 Sol,但监控手段本身的可依赖度却在下降。这一趋势意味着,仅靠观察模型内部推理过程来确保安全,未来可能不再可行。

作者进一步推测,对齐研究的进展可能最终导向机器递归自我改进(RSI),即模型自主优化自身对齐能力。这种路径虽然可能提升安全水平,但也带来失控风险。为此,文章提出三项具体倡议:自愿放缓模型扩展速度、建立独立的第三方安全评估门槛,以及加强国际范围内的政策协调。

分析人士指出,这份长文反映了OpenAI对技术前沿风险的审慎态度,同时也暴露了当前对齐方法的局限性。随着模型能力逼近甚至超越人类认知边界,如何在不依赖透明推理的前提下保障AI行为可控,正成为行业亟需解决的课题。

OpenAIAI对齐链式思维模型安全
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词