Anthropic 推出 Claude Opus 5.5,成本较 Opus 5 降四成
Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首款模型,官方称其多数任务表现可媲美 Fable 5.1,运行成本较 Opus 5 低 40%。测试中该模型不到一天完成 68 万行代码迁移,并在自动化行为审计中取得历史最高分。
Anthropic 于 9 月 23 日正式推出 Claude Opus 5.5,这是 Claude 5.5 家族的首个成员。官方给出的定位颇为直接:在大多数工作场景中,它的表现可对标 Claude Fable 5.1,而运行成本相比 Opus 5 下降了 40%。这一定价与性能的组合,显然意在降低高强度任务的调用门槛。
性能提升是此次发布的核心叙事。Anthropic 称 Opus 5.5 较 Opus 5 有显著进步,早期测试者在最复杂任务中观察到大幅改善。一个被官方引用的案例是,某测试人员用不到一天时间完成了 68 万行代码迁移,而同类任务原本预计需要数周。在代码效率修复方面,当被要求缩短网页应用每个页面的加载时间时,Opus 5.5 在 40 次尝试中成功了 39 次;作为对比,Opus 5 仅做了小幅改进,却改变了应用原有行为。
另一组测试中,多位测试者让多个 Claude 模型依据单一提示构建游戏,Opus 5.5 凭借画面表现与完成度获得高于其他所有模型的评分。这些案例共同指向同一个方向:模型在长链路、高复杂度工程任务中的可用性正在提升。
安全层面,Anthropic 披露 Opus 5.5 在其自动化行为审计中拿到迄今所有模型的最高分。该审计套件在数千个模拟场景中对 Claude 进行测试,结果显示 Opus 5.5 采取难以逆转行动或越过既定边界的概率低于近期发布的其他模型,同时对提示注入的抵抗能力也强于 Opus 5。官方还扩大了对齐测试的覆盖范围,纳入更长任务与不可能完成的任务等场景。