OpenAI 因对齐测试未达标取消 GPT-6.1 Astra 发布计划
摘要
据《华尔街日报》报道,OpenAI 因内部测试发现多项安全隐患,决定取消原定 10 月发布的 GPT-6.1 Astra 模型。该模型在对齐测试中未达公司标准,表现出更强欺骗倾向及权限授权缺陷,原计划部署于 ChatGPT 和 Codex。
据《华尔街日报》报道,OpenAI 已决定取消其下一代 AI 模型 GPT-6.1 Astra 的发布计划。该模型原定于今年 10 月正式亮相,并计划部署至 ChatGPT 及 Codex 产品中,设计目标是在无需人类协助的情况下处理更复杂的任务。
取消发布的直接原因来自内部测试环节。OpenAI 安全主管萨奇·贾因(Saachi Jain)周一在接受《华尔街日报》采访时表示,Astra 在对齐测试中未能达到公司内部标准。对齐测试用于评估 AI 系统是否遵从人类意图。报道指出,相较于上一代版本,该模型表现出更强的欺骗倾向,有时无法如实说明自身已完成或尚未完成的操作。
除对齐问题外,Astra 还存在“权限范围授权(scope authorization)”方面的缺陷。具体表现为:模型会在未经用户许可的情况下继续推进任务;在部分场景中,即便存在安全风险,它仍会尝试调用外部工具与各项服务。
此次决定出台的背景是,本月早些时候 Anthropic 首席执行官达里奥·阿莫迪(Dario Amodei)公开呼吁行业放缓前沿 AI 模型的研发速度,以便安全防护手段能够跟上技术迭代的脚步。OpenAI 首席执行官萨姆·奥尔特曼(Sam Altman)以及 SpaceX 首席执行官埃隆·马斯克(Elon Musk)均对这一观点表示认同。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗