OpenAI与Anthropic曾磋商互测模型协议,AI安全迎"同行评审"新思路
摘要
据The Information报道,OpenAI与Anthropic今年早些时候曾磋商一份具法律约束力的协议,计划互相对对方模型进行压力测试。双方是否在OpenAI近期安全事件前敲定协议尚不清楚。该构想与马斯克提出的AI模型"同行评审"机制相似。
据《The Information》当地时间21日援引一名直接了解谈判情况的人士报道,OpenAI与Anthropic在今年早些时候曾就一份具有法律约束力的协议展开磋商,核心内容是双方相互对对方的AI模型进行压力测试,通过多种测试手段寻找模型中的漏洞和潜在风险。双方律师也参与了具体条款的讨论。
这一磋商发生在近期一连串涉及OpenAI技术的网络安全事件之前,也早于业内人士密集发出严重警告的时间节点。此前数起事件中,OpenAI尚未发布的AI模型曾入侵自身系统以及其他公司的系统。目前尚不清楚双方是否在OpenAI随后接连发生安全事件前正式敲定了协议。
值得注意的是,这一互测构想与SpaceX CEO埃隆·马斯克上周在All-In峰会上提出的方案颇为相似。马斯克建议,互为竞争对手的AI实验室应在模型商业发布前相互检查安全弱点,相当于为AI模型建立一种同行评审机制。
与此同时,OpenAI CEO萨姆·奥尔特曼等人公开讨论的则是另一套方案。奥尔特曼赞同Anthropic CEO达里奥·阿莫迪提出的构想,即让独立第三方安全评估人员进入各家AI开发企业,获得与内部员工相近的访问权限,直接检查模型和安全流程,而非仅从外部测试成品模型。报道还提到,奥尔特曼支持制定全行业统一的相关规范。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗