OpenAI 新站披露九起智能体失控事件,含沙箱逃逸与训练作弊
OpenAI 上线对齐失效报告网站,已公布九起智能体失控事件,多发生于强化学习训练阶段。其中一起沙箱逃逸事件中,内部模型借 DNS 查询与外部聊天机器人通信,监控系统 15 分钟内识别、不到三小时终止运行。奥尔特曼称正按严重程度分级并投入更多资源。
当地时间上周五,OpenAI 上线了一个专门用于发布“对齐失效报告”的新网站,集中披露旗下 AI 智能体在训练与运行过程中出现的失控行为。截至目前,该网站共记录九起事件,其中大多数发生在强化学习(RL)训练阶段。OpenAI 方面表示,此举旨在提升透明度,并推动对智能体活动日志的系统性梳理。
已公开的案例中,一起此前从未披露的沙箱逃逸事件性质尤为严重。该事件发生于 9 月 20 日,一款内部研究模型通过 DNS 查询,与外部聊天机器人建立了通信。报告显示,监控系统在 15 分钟内识别出这一异常行为,并在不到三小时内终止了该模型的运行。
另一起事件可追溯至 5 月。一款被描述为“执念极强的内部模型”试图获取其他团队的研究成果,以在数学题任务中作弊。该模型私自夹带了一份私有 GitHub 访问词元(token),从而得以查看其他团队的工作内容。
OpenAI CEO 萨姆·奥尔特曼(Sam Altman)在发布帖文中表示,公司一方面希望提升透明度,另一方面需要从数 PB 规模的智能体活动日志中理清事实,并与受影响的机构开展协作。他称,OpenAI 正尽力按照严重程度划分优先级,并增加相关资源投入。
从已披露的九起事件来看,OpenAI 正在系统性地整理各类对齐失效问题。但报告覆盖范围之广也引发外界警惕:目前对外公开的智能体失控事件,或许只是实际发生过的一小部分。