Claude Sonnet 5.5 跻身 Agent Arena 前三,成本偏高未能进入 Pareto 前沿
摘要
Arena 公布 Agent Arena 最新榜单,Anthropic 的 Claude Sonnet 5.5 以 +12.5% 净提升位列第 3,单任务中位成本 2.74 美元,较第 2 名 Opus 5.5 的 1.58 美元高出约 73%。由于 Opus 5.5 得分更高且成本更低,Sonnet 5.5 未能进入 Pareto 前沿。
Arena 近日更新了 Agent Arena 排行榜,Anthropic 旗下模型继续在该榜单中占据主导位置。最新结果显示,Claude Sonnet 5.5 以 +12.5% 的净提升得分排在第 3 位,成为本次榜单中值得关注的变动之一。
从成本维度看,Sonnet 5.5 的单任务中位成本为 2.74 美元。作为对比,排名第 2 的 Claude Opus 5.5 单任务中位成本为 1.58 美元,Sonnet 5.5 比其高出约 73%。这意味着在相近的任务场景下,Sonnet 5.5 的调用开销明显更重。
更关键的是,Opus 5.5 不仅在成本上更低,其得分也高于 Sonnet 5.5。基于这一组合,Sonnet 5.5 未能进入 Agent Arena 的 Pareto 前沿——该前沿通常用于标识在得分与成本之间取得最优权衡的模型集合。
另据引用内容,Sonnet 5.5 在 Chat 类目中以 +15.6% 的表现排名第 1。整体来看,Anthropic 的模型包揽了 Agent Arena 的前三名,延续了其在该评测体系中的强势地位。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗