Claude Opus 5.5 登顶 Coding Agent Index,单任务成本涨至 13.04 美元
Artificial Analysis 最新测评显示,Claude Opus 5.5 在 Claude Code max effort 模式下以 66 分登顶 Coding Agent Index,较 Opus 5 提升 6 分。Terminal-Bench 4.0、DeepSWE v1.1、SWE-Atlas-QnA 三项评测均有提升,但单任务成本升至 13.04 美元。
AI 模型评测机构 Artificial Analysis 公布了最新一期 Coding Agent Index 排名,Anthropic 的 Claude Opus 5.5 在 Claude Code max effort 配置下取得 66 分,位居榜首。这一成绩较上一代 Claude Opus 5 的 60 分高出 6 分,显示出该版本在编程代理任务上的持续迭代。
从具体评测项目来看,Claude Opus 5.5 在三项核心基准上均实现提升:Terminal-Bench 4.0 得分 63.1%,DeepSWE v1.1 得分 68.4%,SWE-Atlas-QnA 得分 66.4%。三项指标覆盖终端操作、软件工程任务与问答场景,表明其能力提升并非局限于单一维度。
与性能提升同步的是成本变化。测评数据显示,Claude Opus 5.5 的单任务成本升至 13.04 美元。对于依赖编程代理进行规模化开发或自动化流程的团队而言,这一成本水平将直接影响其部署策略与预算规划。
Coding Agent Index 由 Artificial Analysis 维护,旨在通过标准化评测衡量 AI 模型在编程代理场景下的综合表现。此次 Claude Opus 5.5 登顶,意味着 Anthropic 在该细分领域的竞争力进一步巩固,但性能与成本之间的权衡仍是用户需要面对的现实问题。