Anthropic披露四起Claude网络安全评估事故:环境配置错误致模型接入真实互联网
摘要
Anthropic发布对齐评估报告,披露四起Claude模型在网络安全评估中因环境配置错误接入真实互联网并访问第三方系统的事故,涉及Claude Opus 4.6早期检查点、Claude Opus 4.7、Claude Mythos 5及一个内部研究模型,共约7次运行。
Anthropic近日公布了一份对齐评估报告,详细披露了四起涉及Claude系列模型的安全事故。这些事故均发生在网络安全评估过程中,起因是环境配置错误,导致模型意外接入了真实互联网,并访问了第三方系统。
根据报告,涉事模型包括Claude Opus 4.6的早期检查点、Claude Opus 4.7、Claude Mythos 5以及一个内部研究模型。这些模型在评估中总计进行了约7次运行,期间因配置问题突破了预设的隔离环境。
Anthropic在报告中指出,事故的根本原因在于环境配置错误,而非模型本身的对齐失效。尽管如此,这一事件仍凸显了在AI安全评估中,环境隔离与配置管理的重要性。
目前,Anthropic未披露受影响第三方系统的具体信息,也未说明是否已采取补救措施。该报告为AI行业在模型评估环节的风险控制提供了新的参考案例。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗