快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →
深度观察 新大陆研究院 约 2 分钟读完 素材来源 AIHOT

OpenAI GPT-6 Astra 登顶 ARC-AGI-3,成本效率双突破

OpenAI 最新模型 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 评测中刷新纪录:Standard harness 得分 62.7%(成本 2.6 万美元),Provider Adapter harness 得分 99.9%(成本 1.9 万美元),均达当前最优水平,展现推理能力与成本控制的双重优势。

通用人工智能评测领域迎来新的技术标尺。ARC-AGI-3 作为面向抽象推理与泛化能力的高难度基准,其 Semi-Private 版本因未公开测试集而更具参考价值,被视为衡量模型智能水平的前沿试金石。

OpenAI 于近期公布的最新模型 GPT-6 Astra 在此项测试中表现突出。官方数据显示,在 Standard harness 配置下,模型取得 62.7% 的准确率,对应推理成本约为 2.6 万美元;而在 Provider Adapter harness 配置下,得分跃升至 99.9%,成本反而降至约 1.9 万美元。两项成绩均为该基准上的最优结果(SOTA)。

值得注意的是,两种 harness 的得分差异揭示了模型在不同接口适配条件下的性能弹性。Provider Adapter 模式通过优化推理调用路径,不仅显著提升了准确率,还降低了算力开销,这一结果对实际部署中的成本效率优化具有直接参考意义。

目前,ARC-AGI-3 的完整排行榜尚未公开,但 GPT-6 Astra 的上述成绩已引发业界对下一代推理架构的讨论。分析人士指出,高难度基准上的高分与成本下降并存,可能意味着模型在算法层面实现了更高效的搜索或验证机制,而非单纯依赖算力堆叠。

随着半私有评测集逐渐成为衡量模型泛化能力的新标准,此次结果或将为后续模型迭代和评测方法论的发展提供重要参照。OpenAI 尚未透露 GPT-6 Astra 的技术细节及公开发布时间表。

OpenAIGPT-6ARC-AGI-3AI评测
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词