快讯 23:41Perplexity 红队测试 SPACE 沙箱:9 个模型 108 次运行均未逃逸 VM23:08Instinct获10亿美元融资,估值百亿,AI智能体赛道热度不减22:53小米大模型负责人罗福莉晋升22级 已达职级体系最高档 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期二 · 09-29 02:30 约 1 分钟读完

Claude Sonnet 5.5 登陆 Arena 智能体评测,开放公众投票

摘要

Arena 宣布 Anthropic 的 Claude Sonnet 5.5 已进入 Agent Arena 并开放投票。该评测基于全球用户数百万个真实长程智能体任务,模型可调用 web search、filesystem 和 terminal 工具完成复杂工作流,榜单采用因果追踪方法衡量模型相对平均模型的结果表现。

AI 模型评测平台 Arena 近日宣布,Anthropic 旗下的 Claude Sonnet 5.5 已正式进入其 Agent Arena 评测体系,并面向公众开放投票通道。

Agent Arena 的评测基础来自全球用户提交的数百万个真实长程智能体任务。在这些任务中,模型需要调用 web search、filesystem 和 terminal 等工具,完成具有一定复杂度的多步骤工作流。

与常规评测不同,该榜单采用因果追踪方法,衡量的是模型相对于平均模型的结果表现。这一设计意在更清晰地呈现模型在真实任务链条中的实际贡献,而非仅看单一任务的完成与否。

Claude Sonnet 5.5 的加入,意味着 Anthropic 的最新产品将在这一公开评测框架下接受来自真实用户任务的检验。投票开放后,开发者与用户的反馈将逐步反映在榜单结果中。

Claude Sonnet 5.5AnthropicAgent ArenaAI评测
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
53
企业落地案例
7
完整版提示词