快讯 23:36AMD未发布锐龙9 5900X3D工程样品曝光:12核配32MB+96MB L3缓存16:00Ai2开源8B科学报告生成模型AstaBrief,已上线Asta平台08:00Epoch AI 测算:2025至2027年HBM产能可承载千万级并发前沿智能体 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期六 · 10-03 03:33 约 1 分钟读完

Claude Sonnet 5.5 跻身 Agent Arena 前三,成本偏高未能进入 Pareto 前沿

摘要

Arena 公布 Agent Arena 最新榜单,Anthropic 的 Claude Sonnet 5.5 以 +12.5% 净提升位列第 3,单任务中位成本 2.74 美元,较第 2 名 Opus 5.5 的 1.58 美元高出约 73%。由于 Opus 5.5 得分更高且成本更低,Sonnet 5.5 未能进入 Pareto 前沿。

Arena 近日更新了 Agent Arena 排行榜,Anthropic 旗下模型继续在该榜单中占据主导位置。最新结果显示,Claude Sonnet 5.5 以 +12.5% 的净提升得分排在第 3 位,成为本次榜单中值得关注的变动之一。

从成本维度看,Sonnet 5.5 的单任务中位成本为 2.74 美元。作为对比,排名第 2 的 Claude Opus 5.5 单任务中位成本为 1.58 美元,Sonnet 5.5 比其高出约 73%。这意味着在相近的任务场景下,Sonnet 5.5 的调用开销明显更重。

更关键的是,Opus 5.5 不仅在成本上更低,其得分也高于 Sonnet 5.5。基于这一组合,Sonnet 5.5 未能进入 Agent Arena 的 Pareto 前沿——该前沿通常用于标识在得分与成本之间取得最优权衡的模型集合。

另据引用内容,Sonnet 5.5 在 Chat 类目中以 +15.6% 的表现排名第 1。整体来看,Anthropic 的模型包揽了 Agent Arena 的前三名,延续了其在该评测体系中的强势地位。

AnthropicClaude Sonnet 5.5Agent ArenaPareto 前沿
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
57
企业落地案例
9
完整版提示词