快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期五 · 09-04 05:46 约 1 分钟读完

GPT-6 Astra刷新ARC-AGI-3纪录,基准测试趋于饱和引热议

摘要

OpenAI的GPT-6 Astra在ARC-AGI-3基准上达到SOTA,标准测试得分63%,经新适配器提升至99%,并在96%关卡超越人类。Greg Brockman转发称基准已饱和,引发对AI评估体系有效性的讨论。

OpenAI联合创始人Greg Brockman近日转发ARC Prize的评测结果,确认其新一代模型GPT-6 Astra在抽象推理基准ARC-AGI-3上达到当前最优水平。Brockman同时指出,该基准已趋于饱和,暗示其在区分顶尖模型能力上的边际效用正在减弱。

据ARC Prize官方数据,GPT-6 Astra在标准评测环境下得分为63%,但通过新引入的Provider Adapter harness,得分跃升至99%。这一显著提升源于适配器优化了模型的推理路径,使其在96%的ARC-AGI-3关卡上表现超越人类平均水平。

值得关注的是,评测图表显示,采用更高推理层级的配置往往带来更低的计算成本。Astra在解决任务时使用更少的动作步骤,从而减少了模型调用次数和token消耗,这为高性能AI的经济性运营提供了新证据。

业内分析认为,ARC-AGI-3的饱和可能促使研究者重新审视现有基准的设计逻辑。随着模型在特定任务上逼近或超越人类,如何构建更具挑战性的评估框架,已成为AI社区面临的新课题。OpenAI尚未就GPT-6 Astra的正式发布计划发表评论。

GPT-6ARC-AGI-3基准测试OpenAI
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词