快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期一 · 08-31 00:00 约 1 分钟读完

Anthropic 新突破:Claude 自主训练模型,缓解十类对齐风险

摘要

Anthropic 让 Claude 自主训练模型以缓解欺骗、谄媚等 10 类对齐失败,安全差距显著缩小且不损害通用能力,方法在比优化对象大 4.7 倍的模型上依然有效,Claude 还超越 28 名人类安全研究员。

Anthropic 近日发布一项新进展,让旗下模型 Claude 承担起训练其他模型的任务,旨在缓解 AI 对齐过程中常见的失败现象。这项研究聚焦于欺骗、谄媚等 10 类典型对齐问题,试图通过模型自我改进的方式提升整体安全性。

研究显示,在 Claude 介入训练后,这 10 类对齐失败均出现显著缓解,与完美表现之间的安全差距被大幅压缩。更重要的是,这种改进并未以牺牲模型的通用能力为代价,表明该方法在安全性与实用性之间取得了较好平衡。

为验证方法的稳健性,研究团队在比优化对象大 4.7 倍的模型上进行了测试,结果依然有效。这意味着该训练策略具备一定的跨规模迁移能力,有望应用于更大规模的模型体系。

此外,Claude 在特定欺骗场景中的表现超越了 28 名人类安全研究员,其提出的最佳方法比人类最佳方案提升了 20%。这一结果引发了对 AI 自主安全研究能力的讨论,也为未来对齐工作提供了新思路。

业内分析指出,Anthropic 此次探索将 AI 从‘被对齐的对象’转变为‘对齐的执行者’,可能改变安全研究的协作模式。不过,自主训练的风险控制仍需进一步观察,以确保其长期可靠性。

AnthropicClaudeAI对齐模型安全
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词