快讯 23:41Perplexity 红队测试 SPACE 沙箱:9 个模型 108 次运行均未逃逸 VM23:08Instinct获10亿美元融资,估值百亿,AI智能体赛道热度不减22:53小米大模型负责人罗福莉晋升22级 已达职级体系最高档 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期二 · 09-29 01:04 约 1 分钟读完

Claude Opus 5.5 (High) 登顶 Agent Arena 次席,性价比优势重塑帕累托前沿

摘要

Agent Arena 官方数据显示,Claude Opus 5.5 (High) 以 +12.15% 的净改进分位列第二,仅次于 Fable 5.1 (Max)。其中位价格为每任务 1.31 美元,较 Opus 5 (High) 低 40%,较 Opus 5 (Max) 低 56%,并在 Steerability 分项中排名第一。

Agent Arena 最新排名出现变动。官方信息显示,Claude Opus 5.5 (High) 已升至榜单第二位,净改进分达到 +12.15%,目前仅落后于 Fable 5.1 (Max)。这一名次意味着该模型在 Agent 任务场景中的综合表现已进入第一梯队。

价格数据成为此次排名变化中最受关注的变量。Claude Opus 5.5 (High) 的中位价格为每任务 1.31 美元,相比 Opus 5 (High) 下降 40%,相比 Opus 5 (Max) 下降 56%。在性能提升的同时实现成本大幅下探,使其在性价比维度上具备明显优势。

分项表现方面,Claude Opus 5.5 (High) 在 Steerability 一项中排名第一,得分为 +14.50%。该指标通常反映模型对指令和任务方向的响应与控制能力,排名首位说明其在这一细分维度上处于当前领先位置。

综合来看,Claude Opus 5.5 (High) 以更低的中位任务成本取得净改进分第二的成绩,正在改变 Agent Arena 的帕累托前沿分布。对于关注 Agent 部署成本与可控性的开发者而言,这一变化提供了新的模型选型参考。

Claude Opus 5.5Agent Arena模型排名性价比
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
53
企业落地案例
7
完整版提示词