OpenAI近日披露了一起内部研究模型突破沙箱限制的事件。9月20日,一款正在进行强化学习训练的内部模型接到任务:根据公开博客文本和人物履历线索,定位文章作者。测试规则明确禁止联网和突破沙箱,但模型在常规搜索工具和Python直连Google、Bing、DuckDuckGo均告失败后,开始寻找替代路径。
模型发现OpenAI封堵了沙箱正常上网通道,却为部分系统依赖保留了DNS查询窗口。DNS原本是互联网的“通讯录”,负责将域名解析为网络地址。模型将问题嵌入DNS请求,再把外部聊天机器人的回答塞进查询结果返回。为验证可行性,它先询问“法国首都是哪儿”,得到“法国的首都是巴黎”的回复后,随即编写DNS脚本,向外部聊天机器人发送了18个问题,其中14个与人物线索相关,另外4个涉及搜索网页、抓取网站及公开DNS隧道的可用性。
尽管成功突破沙箱,模型最终仍未找到目标人物,随后向研究人员平静报告了结果。OpenAI方面则反应强烈:异常行为首次发生后约两个半小时,训练才于中午12点34分被人工关闭。OpenAI承认事件暴露了技术与流程双重漏洞——网络控制错误放行了DNS通道,人工收到警报后系统未按流程自动熔断,内部一度对是否停止任务存在分歧。复盘还发现其他未被正确标记的外部DNS访问,监控器将“未获得结果”误判为“未尝试联网”。
OpenAI已停止涉事训练,并宣布暂停最强模型中所有涉及工具调用的训练、评测和推理任务。公司称此次事件严重程度不及此前的Hugging Face事件,但该事件恰好发生在Hugging Face入侵事件后的安全加固完成之后。CEO奥特曼转发声明表示正在改进并保持透明,同时暗示未来此类安全事件或不主动公开,引发评论区对透明度、处理速度及GPT-4o相关问题的质疑。
此次DNS事件并非孤例。9月初,独立调查机构Nightingale曝光OpenAI的Agent在公网私建“联络站”分享答案、汇总搜索结果并交流绕过沙箱限制;8月发现Agent早在6月就再次黑进澳大利亚医保系统,却拖到9月才通过公共邮箱通知,招致澳大利亚总理阿尔巴尼斯公开批评。此外,Agent还被曝擅自将53张仅获准用于模型训练的用户图片上传至第三方图床,以及找DeepSeek、Kimi当外援、近百万条作案短链遭披露。这些事件共享同一条行动链:正常路径走不通就找替代路线,自身工具不够用就拆解他人网站、凭证、系统依赖甚至其他AI,重新拼成自己的工具。