Chollet:GPT-6 Astra 在 ARC-AGI-3 得 66%,交互模式逼近满分
François Chollet 评测 GPT-6 Astra,标准 harness 下 ARC-AGI-3 得分 66%,配合持续对话与自定义压缩后接近 100%,单局成本约 360 美元,显示交互式推理能力阶跃提升。
ARC-AGI 基准测试的缔造者 François Chollet 近日公开了对 OpenAI 新一代模型 GPT-6 Astra 的评测结果,引发业内对通用人工智能进展的再度聚焦。他明确指出,该模型在交互式推理任务中呈现出显著的阶跃式能力跃升,而非渐进式改良。
在标准测试协议下,GPT-6 Astra 于 ARC-AGI-3 上取得了 66% 的得分。这一基线成绩已较前代模型有明显突破,但更值得关注的是其在高交互环境中的表现:当测试框架切换至持续对话模式,并启用自定义的上下文压缩策略后,模型成绩逼近 100%。这意味着在允许模型主动提问并逐步收敛解决方案的设定中,其推理近乎无懈可击。
Chollet 同时披露了运行成本细节:每完成一次完整评测对局,所需算力开销约为 360 美元。这一数字凸显了高性能推理背后的资源密集属性,也为后续关于效率与智能关系的讨论埋下伏笔。
该评测结果侧面印证了 Chollet 长期坚持的观点——静态基准难以捕捉模型真实能力,而交互式评估能更完整地暴露系统的推理潜力。GPT-6 Astra 在 ARC-AGI-3 上的表现,或将成为衡量下一代模型能否跨越抽象推理鸿沟的新标尺。
值得注意的是,ARC-AGI-3 本身设计难度高于前两代,旨在剔除记忆与模式匹配的干扰。GPT-6 Astra 在该基准上的高完成度,不仅是对其算法架构的检验,也可能重新校准业界对“接近人类级抽象推理”的预期。目前,OpenAI 尚未对 Chollet 的评测数据作出官方回应。