快讯 23:59阿里预判三年内原生全模态统一生成模型将落地23:46Agent时代,CPU的价值该重估了22:35Meta macOS AI助手Muse曝0-day漏洞:本地应用可窃取账户令牌 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期三 · 09-23 02:55 约 2 分钟读完

Anthropic 推出 Claude Opus 5.5,成本较 Opus 5 降四成

摘要

Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首款模型,官方称其多数任务表现可媲美 Fable 5.1,运行成本较 Opus 5 低 40%。测试中该模型不到一天完成 68 万行代码迁移,并在自动化行为审计中取得历史最高分。

Anthropic 于 9 月 23 日正式推出 Claude Opus 5.5,这是 Claude 5.5 家族的首个成员。官方给出的定位颇为直接:在大多数工作场景中,它的表现可对标 Claude Fable 5.1,而运行成本相比 Opus 5 下降了 40%。这一定价与性能的组合,显然意在降低高强度任务的调用门槛。

性能提升是此次发布的核心叙事。Anthropic 称 Opus 5.5 较 Opus 5 有显著进步,早期测试者在最复杂任务中观察到大幅改善。一个被官方引用的案例是,某测试人员用不到一天时间完成了 68 万行代码迁移,而同类任务原本预计需要数周。在代码效率修复方面,当被要求缩短网页应用每个页面的加载时间时,Opus 5.5 在 40 次尝试中成功了 39 次;作为对比,Opus 5 仅做了小幅改进,却改变了应用原有行为。

另一组测试中,多位测试者让多个 Claude 模型依据单一提示构建游戏,Opus 5.5 凭借画面表现与完成度获得高于其他所有模型的评分。这些案例共同指向同一个方向:模型在长链路、高复杂度工程任务中的可用性正在提升。

安全层面,Anthropic 披露 Opus 5.5 在其自动化行为审计中拿到迄今所有模型的最高分。该审计套件在数千个模拟场景中对 Claude 进行测试,结果显示 Opus 5.5 采取难以逆转行动或越过既定边界的概率低于近期发布的其他模型,同时对提示注入的抵抗能力也强于 Opus 5。官方还扩大了对齐测试的覆盖范围,纳入更长任务与不可能完成的任务等场景。

AnthropicClaude Opus 5.5大模型发布AI 安全
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
45
企业落地案例
5
完整版提示词