快讯 23:41Perplexity 红队测试 SPACE 沙箱:9 个模型 108 次运行均未逃逸 VM23:08Instinct获10亿美元融资,估值百亿,AI智能体赛道热度不减22:53小米大模型负责人罗福莉晋升22级 已达职级体系最高档 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期二 · 09-29 02:02 约 1 分钟读完

Claude Opus 5.5 (High) 登顶 Agent Arena 次席,成本较同级低 64%

摘要

Agent Arena 最新排名显示,Claude Opus 5.5 (High) 以 +12.15% 净提升分位列第二,仅次于 Claude Fable 5.1 (Max)。其每任务中位价格仅 $1.31,较同水平低 64%,并比 Opus 5 (High) 和 Opus 5 (Max) 分别低 40% 和 56%,Steerability 分项排名第一。

Agent Arena 最新榜单迎来变动。Claude Opus 5.5 (High) 以 +12.15% 的净提升分数跻身第二名,仅次于 Claude Fable 5.1 (Max),在竞争激烈的智能体评测中占据高位。

成本表现是此次排名的一大看点。数据显示,Claude Opus 5.5 (High) 的每任务中位价格仅为 $1.31,比同水平低 64%。与自家前代相比,其成本比 Opus 5 (High) 低 40%,比 Opus 5 (Max) 低 56%,在性能与开销之间呈现出更优的平衡。

分项能力上,Claude Opus 5.5 (High) 的 Steerability 排名第一,净提升 +14.50%,显示其在指令跟随与行为可控性方面具备突出优势。这一信号也解释了其整体排名跃升的部分原因。

综合来看,Claude Opus 5.5 (High) 凭借更低的每任务成本和领先的可控性指标,正在重塑 Agent Arena 的 Pareto 前沿,为智能体部署的性价比选择提供了新参照。

Claude Opus 5.5Agent Arena成本效率Steerability
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
53
企业落地案例
7
完整版提示词