快讯 23:59阿里预判三年内原生全模态统一生成模型将落地23:46Agent时代,CPU的价值该重估了22:35Meta macOS AI助手Muse曝0-day漏洞:本地应用可窃取账户令牌 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期三 · 09-23 01:48 约 1 分钟读完

Claude Opus 5.5 登陆 Arena 双模式,Agent 评测引入因果追踪

摘要

Arena 宣布 Anthropic 的 Claude Opus 5.5 已进入 Agent Arena,用户可投票驱动排行榜。该评测基于全球用户提交的数百万真实长程智能体任务,模型可调用网页搜索、文件系统和终端工具,排行榜采用因果追踪方法衡量相对平均模型的结果表现。

AI 模型评测平台 Arena 近日更新了其 Agent Arena 阵容,Anthropic 的 Claude Opus 5.5 正式出现在该评测体系中。与常规基准测试不同,Agent Arena 的排名并非由固定题库决定,而是由社区用户的投票行为直接驱动。

支撑这一排行榜的数据基础,来自全球用户提交的数百万个真实长程智能体任务。这些任务并非短平快的问答,而是需要模型在较长流程中持续决策、调用外部能力的复杂场景。在评测过程中,模型被允许使用网页搜索、文件系统和终端工具,以更接近实际部署环境的条件完成任务。

在结果衡量上,Agent Arena 采用了因果追踪方法,用于评估模型相对于平均模型的表现差异。这一设计意在剥离任务难度波动带来的干扰,让排名更能反映模型自身的能力增量,而非单纯的任务通过率。

Claude Opus 5.5 进入该榜单,意味着 Anthropic 的最新旗舰模型将在真实长程任务与工具调用场景中接受公开对比。对于关注智能体落地能力的从业者而言,Agent Arena 的投票驱动机制和因果追踪指标,提供了一种区别于传统静态基准的观察视角。

Claude Opus 5.5ArenaAgent Arena智能体评测
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
45
企业落地案例
5
完整版提示词