GPT-6.1 登陆 Agent Arena,智能体任务评估引入用户投票机制
摘要
Arena 宣布 OpenAI 的 GPT-6.1 已上线 Agent Arena,用户投票将影响其评估,分数即将公布。该平台通过数百万个真实世界长时程智能体任务评测模型,支持调用网页搜索、文件系统和终端工具完成复杂工作流,排行榜采用因果追踪方法衡量模型相对平均模型的表现。
AI 评测平台 Arena 近日宣布,OpenAI 的 GPT-6.1 已正式上线其 Agent Arena 评估环境。这一动作意味着该模型将接受面向智能体场景的专项测试,而用户的投票结果会直接参与其评估过程,具体分数将在后续公布。
与传统的静态问答评测不同,Agent Arena 的测试集由数百万个真实世界、长时程的智能体任务构成。在这些任务中,模型需要调用网页搜索、文件系统和终端工具,完成多步骤的复杂工作流。这种设计更贴近模型在实际生产环境中的使用方式。
在排名机制上,Agent Arena 的排行榜采用因果追踪方法,衡量的是模型相对于平均模型的结果表现。这一方法旨在剥离任务难度等混杂因素,更准确地反映模型自身能力带来的增量。
GPT-6.1 的加入,使 Agent Arena 的竞争格局进一步升温。随着用户投票与因果追踪评估的结合,该平台能否成为智能体能力评测的参考标准,值得持续关注。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗