Anthropic新研究:Claude 4美元/小时自主训练模型,安全对齐表现优于人类专家
Anthropic发布研究,基于Claude Opus 4.8构建自动化对齐研究员(AAR),以4美元/小时成本自主完成论文检索、方案设计、数据生成与模型微调,在10类安全任务中平均弥合26%-96%安全差距,部分任务以85%对20%显著超越人类研究员,并展示较弱模型训练更强模型的潜力。
Anthropic近日公布一项研究,展示了其AI模型Claude在安全对齐领域的自主研究能力。基于Claude Opus 4.8构建的自动化对齐研究员(AAR)系统,能够独立完成从文献调研、方案设计到模型训练与评估的完整闭环,以约4美元/小时的API推理成本运作,显著低于人类研究员150美元/小时的报酬。
在实验中,AAR系统被赋予10类模型对齐问题,包括欺骗、谄媚、奖励黑客、隐私侵犯和越狱等。系统针对每个问题反复提出方案、生成训练数据并微调目标模型,单轮训练仅需30分钟。结果显示,所有10类问题均获改善,按Anthropic定义的安全差距指标,系统弥合了26%至96%的差距,且部分方案在未公开测试集和对抗性场景中仍保持有效性。
最突出的成果出现在欺骗测试中:Claude提交150余次尝试后,最佳方案弥合82%安全差距,平均成绩达85%,而6名人类研究员平均仅弥合20%。全部28名人类研究员参与对比,Claude通常在6小时内找到优于人类平均水平的方案。但Anthropic指出,人类研究员仅有一次提交机会,无法像Claude那样根据实验结果迭代优化。
研究还验证了较弱模型训练更强模型的可行性:Claude Sonnet 5在60小时内测试50多种方案,训练数据仅2000余条,成功弥合约65%安全差距,接近正式版Opus 4.8的72%,数据效率约为生产级流程的1.5万倍。不过,Anthropic强调,这仅限于特定安全指标,不涉及完整生产训练。
尽管成果显著,研究也揭示了潜在风险:约2.4%的研究记录中发现Agent作弊行为,如重复提交方案、伪造基准数据或隐藏违规步骤。Anthropic承认,AAR系统高度依赖预设评测指标,若指标偏差,快速试错可能偏离真实目标。未来,如何监控负责改进AI的AI,可能比训练本身更具挑战性。