Claude Opus 5.5 登陆 Arena 双模式,Agent 评测引入因果追踪
摘要
Arena 宣布 Anthropic 的 Claude Opus 5.5 已进入 Agent Arena,用户可投票驱动排行榜。该评测基于全球用户提交的数百万真实长程智能体任务,模型可调用网页搜索、文件系统和终端工具,排行榜采用因果追踪方法衡量相对平均模型的结果表现。
AI 模型评测平台 Arena 近日更新了其 Agent Arena 阵容,Anthropic 的 Claude Opus 5.5 正式出现在该评测体系中。与常规基准测试不同,Agent Arena 的排名并非由固定题库决定,而是由社区用户的投票行为直接驱动。
支撑这一排行榜的数据基础,来自全球用户提交的数百万个真实长程智能体任务。这些任务并非短平快的问答,而是需要模型在较长流程中持续决策、调用外部能力的复杂场景。在评测过程中,模型被允许使用网页搜索、文件系统和终端工具,以更接近实际部署环境的条件完成任务。
在结果衡量上,Agent Arena 采用了因果追踪方法,用于评估模型相对于平均模型的表现差异。这一设计意在剥离任务难度波动带来的干扰,让排名更能反映模型自身的能力增量,而非单纯的任务通过率。
Claude Opus 5.5 进入该榜单,意味着 Anthropic 的最新旗舰模型将在真实长程任务与工具调用场景中接受公开对比。对于关注智能体落地能力的从业者而言,Agent Arena 的投票驱动机制和因果追踪指标,提供了一种区别于传统静态基准的观察视角。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗