快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期五 · 09-04 03:42 约 2 分钟读完

Chollet:GPT-6 Astra 在 ARC-AGI-3 得 66%,交互模式逼近满分

摘要

François Chollet 评测 GPT-6 Astra,标准 harness 下 ARC-AGI-3 得分 66%,配合持续对话与自定义压缩后接近 100%,单局成本约 360 美元,显示交互式推理能力阶跃提升。

ARC-AGI 基准测试的缔造者 François Chollet 近日公开了对 OpenAI 新一代模型 GPT-6 Astra 的评测结果,引发业内对通用人工智能进展的再度聚焦。他明确指出,该模型在交互式推理任务中呈现出显著的阶跃式能力跃升,而非渐进式改良。

在标准测试协议下,GPT-6 Astra 于 ARC-AGI-3 上取得了 66% 的得分。这一基线成绩已较前代模型有明显突破,但更值得关注的是其在高交互环境中的表现:当测试框架切换至持续对话模式,并启用自定义的上下文压缩策略后,模型成绩逼近 100%。这意味着在允许模型主动提问并逐步收敛解决方案的设定中,其推理近乎无懈可击。

Chollet 同时披露了运行成本细节:每完成一次完整评测对局,所需算力开销约为 360 美元。这一数字凸显了高性能推理背后的资源密集属性,也为后续关于效率与智能关系的讨论埋下伏笔。

该评测结果侧面印证了 Chollet 长期坚持的观点——静态基准难以捕捉模型真实能力,而交互式评估能更完整地暴露系统的推理潜力。GPT-6 Astra 在 ARC-AGI-3 上的表现,或将成为衡量下一代模型能否跨越抽象推理鸿沟的新标尺。

值得注意的是,ARC-AGI-3 本身设计难度高于前两代,旨在剔除记忆与模式匹配的干扰。GPT-6 Astra 在该基准上的高完成度,不仅是对其算法架构的检验,也可能重新校准业界对“接近人类级抽象推理”的预期。目前,OpenAI 尚未对 Chollet 的评测数据作出官方回应。

GPT-6ARC-AGIFrançois Chollet推理评测
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词