OpenAI GPT-6 Astra 登顶 ARC-AGI-3,成本效率双突破
OpenAI 最新模型 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 评测中刷新纪录:Standard harness 得分 62.7%(成本 2.6 万美元),Provider Adapter harness 得分 99.9%(成本 1.9 万美元),均达当前最优水平,展现推理能力与成本控制的双重优势。
通用人工智能评测领域迎来新的技术标尺。ARC-AGI-3 作为面向抽象推理与泛化能力的高难度基准,其 Semi-Private 版本因未公开测试集而更具参考价值,被视为衡量模型智能水平的前沿试金石。
OpenAI 于近期公布的最新模型 GPT-6 Astra 在此项测试中表现突出。官方数据显示,在 Standard harness 配置下,模型取得 62.7% 的准确率,对应推理成本约为 2.6 万美元;而在 Provider Adapter harness 配置下,得分跃升至 99.9%,成本反而降至约 1.9 万美元。两项成绩均为该基准上的最优结果(SOTA)。
值得注意的是,两种 harness 的得分差异揭示了模型在不同接口适配条件下的性能弹性。Provider Adapter 模式通过优化推理调用路径,不仅显著提升了准确率,还降低了算力开销,这一结果对实际部署中的成本效率优化具有直接参考意义。
目前,ARC-AGI-3 的完整排行榜尚未公开,但 GPT-6 Astra 的上述成绩已引发业界对下一代推理架构的讨论。分析人士指出,高难度基准上的高分与成本下降并存,可能意味着模型在算法层面实现了更高效的搜索或验证机制,而非单纯依赖算力堆叠。
随着半私有评测集逐渐成为衡量模型泛化能力的新标准,此次结果或将为后续模型迭代和评测方法论的发展提供重要参照。OpenAI 尚未透露 GPT-6 Astra 的技术细节及公开发布时间表。