Claude Sonnet 5.5 登陆 Arena 智能体评测,开放公众投票
摘要
Arena 宣布 Anthropic 的 Claude Sonnet 5.5 已进入 Agent Arena 并开放投票。该评测基于全球用户数百万个真实长程智能体任务,模型可调用 web search、filesystem 和 terminal 工具完成复杂工作流,榜单采用因果追踪方法衡量模型相对平均模型的结果表现。
AI 模型评测平台 Arena 近日宣布,Anthropic 旗下的 Claude Sonnet 5.5 已正式进入其 Agent Arena 评测体系,并面向公众开放投票通道。
Agent Arena 的评测基础来自全球用户提交的数百万个真实长程智能体任务。在这些任务中,模型需要调用 web search、filesystem 和 terminal 等工具,完成具有一定复杂度的多步骤工作流。
与常规评测不同,该榜单采用因果追踪方法,衡量的是模型相对于平均模型的结果表现。这一设计意在更清晰地呈现模型在真实任务链条中的实际贡献,而非仅看单一任务的完成与否。
Claude Sonnet 5.5 的加入,意味着 Anthropic 的最新产品将在这一公开评测框架下接受来自真实用户任务的检验。投票开放后,开发者与用户的反馈将逐步反映在榜单结果中。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗