快讯 23:53Shopify 弃用 React Native,AI 智能体重写 Shop 应用回归原生开发23:45Hugging Face CEO 谈被 NVIDIA 收购:借力招人,以十年周期押注开源 AI23:30NVIDIA 开源表格基础模型 Kumo Tabular,四项基准测试登顶 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期三 · 09-30 02:46 约 1 分钟读完

GPT-6.1 登陆 Agent Arena,智能体任务评估引入用户投票机制

摘要

Arena 宣布 OpenAI 的 GPT-6.1 已上线 Agent Arena,用户投票将影响其评估,分数即将公布。该平台通过数百万个真实世界长时程智能体任务评测模型,支持调用网页搜索、文件系统和终端工具完成复杂工作流,排行榜采用因果追踪方法衡量模型相对平均模型的表现。

AI 评测平台 Arena 近日宣布,OpenAI 的 GPT-6.1 已正式上线其 Agent Arena 评估环境。这一动作意味着该模型将接受面向智能体场景的专项测试,而用户的投票结果会直接参与其评估过程,具体分数将在后续公布。

与传统的静态问答评测不同,Agent Arena 的测试集由数百万个真实世界、长时程的智能体任务构成。在这些任务中,模型需要调用网页搜索、文件系统和终端工具,完成多步骤的复杂工作流。这种设计更贴近模型在实际生产环境中的使用方式。

在排名机制上,Agent Arena 的排行榜采用因果追踪方法,衡量的是模型相对于平均模型的结果表现。这一方法旨在剥离任务难度等混杂因素,更准确地反映模型自身能力带来的增量。

GPT-6.1 的加入,使 Agent Arena 的竞争格局进一步升温。随着用户投票与因果追踪评估的结合,该平台能否成为智能体能力评测的参考标准,值得持续关注。

GPT-6.1Agent ArenaOpenAI智能体评测
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
54
企业落地案例
8
完整版提示词