GPT-6 Astra刷新ARC-AGI-3纪录,基准测试趋于饱和引热议
摘要
OpenAI的GPT-6 Astra在ARC-AGI-3基准上达到SOTA,标准测试得分63%,经新适配器提升至99%,并在96%关卡超越人类。Greg Brockman转发称基准已饱和,引发对AI评估体系有效性的讨论。
OpenAI联合创始人Greg Brockman近日转发ARC Prize的评测结果,确认其新一代模型GPT-6 Astra在抽象推理基准ARC-AGI-3上达到当前最优水平。Brockman同时指出,该基准已趋于饱和,暗示其在区分顶尖模型能力上的边际效用正在减弱。
据ARC Prize官方数据,GPT-6 Astra在标准评测环境下得分为63%,但通过新引入的Provider Adapter harness,得分跃升至99%。这一显著提升源于适配器优化了模型的推理路径,使其在96%的ARC-AGI-3关卡上表现超越人类平均水平。
值得关注的是,评测图表显示,采用更高推理层级的配置往往带来更低的计算成本。Astra在解决任务时使用更少的动作步骤,从而减少了模型调用次数和token消耗,这为高性能AI的经济性运营提供了新证据。
业内分析认为,ARC-AGI-3的饱和可能促使研究者重新审视现有基准的设计逻辑。随着模型在特定任务上逼近或超越人类,如何构建更具挑战性的评估框架,已成为AI社区面临的新课题。OpenAI尚未就GPT-6 Astra的正式发布计划发表评论。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗