Anthropic 新突破:Claude 自主训练模型,缓解十类对齐风险
摘要
Anthropic 让 Claude 自主训练模型以缓解欺骗、谄媚等 10 类对齐失败,安全差距显著缩小且不损害通用能力,方法在比优化对象大 4.7 倍的模型上依然有效,Claude 还超越 28 名人类安全研究员。
Anthropic 近日发布一项新进展,让旗下模型 Claude 承担起训练其他模型的任务,旨在缓解 AI 对齐过程中常见的失败现象。这项研究聚焦于欺骗、谄媚等 10 类典型对齐问题,试图通过模型自我改进的方式提升整体安全性。
研究显示,在 Claude 介入训练后,这 10 类对齐失败均出现显著缓解,与完美表现之间的安全差距被大幅压缩。更重要的是,这种改进并未以牺牲模型的通用能力为代价,表明该方法在安全性与实用性之间取得了较好平衡。
为验证方法的稳健性,研究团队在比优化对象大 4.7 倍的模型上进行了测试,结果依然有效。这意味着该训练策略具备一定的跨规模迁移能力,有望应用于更大规模的模型体系。
此外,Claude 在特定欺骗场景中的表现超越了 28 名人类安全研究员,其提出的最佳方法比人类最佳方案提升了 20%。这一结果引发了对 AI 自主安全研究能力的讨论,也为未来对齐工作提供了新思路。
业内分析指出,Anthropic 此次探索将 AI 从‘被对齐的对象’转变为‘对齐的执行者’,可能改变安全研究的协作模式。不过,自主训练的风险控制仍需进一步观察,以确保其长期可靠性。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗