快讯 23:34Anthropic工程师解析Claude写作退化:模型被训练成写给AI而非人类23:31谷歌发布Gemini 3.8 Flash系列TTS模型,支持自然语言定制语音23:29AI安全事件与数学突破被指炒作,专家称责任在企业疏忽而非模型失控 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期四 · 09-24 09:24 约 1 分钟读完

Claude Opus 5.5 登顶 Coding Agent Index,单任务成本涨至 13.04 美元

摘要

Artificial Analysis 最新测评显示,Claude Opus 5.5 在 Claude Code max effort 模式下以 66 分登顶 Coding Agent Index,较 Opus 5 提升 6 分。Terminal-Bench 4.0、DeepSWE v1.1、SWE-Atlas-QnA 三项评测均有提升,但单任务成本升至 13.04 美元。

AI 模型评测机构 Artificial Analysis 公布了最新一期 Coding Agent Index 排名,Anthropic 的 Claude Opus 5.5 在 Claude Code max effort 配置下取得 66 分,位居榜首。这一成绩较上一代 Claude Opus 5 的 60 分高出 6 分,显示出该版本在编程代理任务上的持续迭代。

从具体评测项目来看,Claude Opus 5.5 在三项核心基准上均实现提升:Terminal-Bench 4.0 得分 63.1%,DeepSWE v1.1 得分 68.4%,SWE-Atlas-QnA 得分 66.4%。三项指标覆盖终端操作、软件工程任务与问答场景,表明其能力提升并非局限于单一维度。

与性能提升同步的是成本变化。测评数据显示,Claude Opus 5.5 的单任务成本升至 13.04 美元。对于依赖编程代理进行规模化开发或自动化流程的团队而言,这一成本水平将直接影响其部署策略与预算规划。

Coding Agent Index 由 Artificial Analysis 维护,旨在通过标准化评测衡量 AI 模型在编程代理场景下的综合表现。此次 Claude Opus 5.5 登顶,意味着 Anthropic 在该细分领域的竞争力进一步巩固,但性能与成本之间的权衡仍是用户需要面对的现实问题。

Claude Opus 5.5Coding Agent IndexArtificial AnalysisAnthropic
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
50
企业落地案例
6
完整版提示词