OpenAI GPT-6 Astra 系统卡披露:思维链自控能力大幅提升
OpenAI 发布 GPT-6 Astra 的 117 页系统卡,显示该模型对自身链式思维的控制能力从 GPT-5.6 Sol 的 16.1% 跃升至 60.9%,同时可监控性显著下降,引发业界对 AI 安全与透明度平衡的新讨论。
OpenAI 近日公开了其下一代旗舰模型 GPT-6 Astra 的详细系统卡,这份长达 117 页的技术文档由 AI 研究者 Rohan Paul 率先梳理并对外解读,揭示了该模型在自我控制机制上的重要变化。
系统卡数据显示,GPT-6 Astra 在控制自身链式思维(Chain-of-Thought)方面的能力出现了跨越式提升,从上一代 GPT-5.6 Sol 的 16.1% 直接跃升至 60.9%。这一指标衡量的是模型对自身内部推理过程的主动干预和调节能力,数值越高意味着模型越能自主管理其思考路径。
与自控能力增强相伴的,是模型可监控性的同步下降。系统卡指出,随着 Astra 对内部推理过程的控制力增强,外部工具对其思维链的观测和追踪难度相应增加。这一此消彼长的关系,使得安全审计人员面临新的挑战:如何在模型自主性与透明度之间找到平衡点。
值得关注的是,GPT-6 Astra 是 OpenAI 首次以独立系统卡形式完整披露安全评估的旗舰模型。文档中详细记录了红队测试、风险缓解措施及局限性说明,但自控指标的大幅变动仍引发了行业对新一代模型治理框架的重新审视。
目前,该模型的具体发布时间尚未公布,但系统卡的披露已让研究社区开始讨论:当模型越来越擅长隐藏自己的思考过程时,现有的对齐与监管工具是否依然有效。这一问题的答案,或将影响后续 AI 安全标准的制定方向。