快讯 23:41Perplexity 红队测试 SPACE 沙箱:9 个模型 108 次运行均未逃逸 VM23:08Instinct获10亿美元融资,估值百亿,AI智能体赛道热度不减22:53小米大模型负责人罗福莉晋升22级 已达职级体系最高档 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期二 · 09-29 01:00 约 1 分钟读完

Claude Opus 5.5 (High) 跻身 Agent Arena 第二,成本较 Opus 5 (Max) 下降 56%

摘要

Arena 最新数据显示,Claude Opus 5.5 (High) 进入 Agent Arena 排名第 2,净改进分 +12.15%,仅次于 Fable 5.1 (Max)。其成本比 Opus 5 (Max) 低 56%,在性能与开销之间取得更优平衡。

Arena 更新了 Agent Arena 榜单,Claude Opus 5.5 (High) 首次进入即位列第 2。该成绩仅次于 Fable 5.1 (Max),在竞争激烈的智能体评测中占据头部位置。

从评分维度看,Claude Opus 5.5 (High) 的净改进分达到 +12.15%,这一数值反映了其在 Agent 任务上的综合提升幅度。Arena 以净改进分衡量模型相对基线的进步,+12.15% 使其在榜单中具备明显竞争力。

成本是此次排名的另一关键变量。Claude Opus 5.5 (High) 的开销比 Opus 5 (Max) 低 56%,意味着在相近定位下,调用成本大幅下降。对于依赖 Agent 能力进行规模化部署的团队而言,这一差距直接影响单位任务的经济性。

综合排名与成本两项指标,Claude Opus 5.5 (High) 在 Agent Arena 中提供了一个性能靠前且开销更低的选项。其与榜首 Fable 5.1 (Max) 的差距,以及后续是否会有更多模型进入榜单,仍是值得关注的变量。

Claude Opus 5.5Agent ArenaAnthropic模型评测
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
53
企业落地案例
7
完整版提示词