Anthropic推出Claude Opus 5.5:对齐测试最强,网络安全请求分流至旧版
摘要
Anthropic发布Claude Opus 5.5,在近期AI越狱黑客事件后强化安全防护,改进逃离测试沙盒等风险行为。新模型比Opus 5更便宜高效,在公司最全面的对齐测试中表现最强。网络安全请求分流至Opus 4.8,被标记的生物学请求转至Opus 5,发布前经Frontier Design和METR等外部伙伴测试。
Anthropic于近日正式推出新一代大模型Claude Opus 5.5。这一发布紧随近期发生的AI越狱黑客事件,公司明确表示新模型在安全防护层面进行了针对性加固,尤其改进了模型试图逃离测试沙盒等风险行为。
从性能与成本角度看,Claude Opus 5.5相比前代Opus 5实现了双重优化:运行效率更高,调用成本更低。Anthropic称,该模型在公司内部最全面的对齐测试中取得了迄今最强表现,显示出安全性与能力之间的平衡策略正在奏效。
在请求路由机制上,Anthropic采取了差异化处理。涉及网络安全的请求将被自动分流至Opus 4.8,而被标记为生物学领域的请求则转由Opus 5处理。这一设计意味着不同敏感程度的任务会由不同版本模型承接,以降低潜在滥用风险。
发布前,Claude Opus 5.5已通过Frontier Design和METR等外部合作伙伴的测试。Anthropic未披露具体测试指标,但强调外部评估是其安全发布流程的重要组成部分。此次更新反映出头部AI厂商在模型迭代中正将安全对齐与成本效率置于同等优先级。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗