快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期五 · 09-04 04:23 约 2 分钟读完

ARC-AGI-3发布半年即遭攻克 模型迭代速度超出预期一倍

摘要

ARC-AGI-3基准测试发布仅6个月便被Astra模型饱和攻克,较François Chollet预测的一年时间缩短一半。这一进展反映出新一代AI模型的能力跃升速度已超出行业预期,或将重塑业界对AI发展节奏的判断。

人工智能基准测试的更新换代速度正在被模型能力的跃升不断压缩。近日,ARC-AGI-3这一被视为衡量通用智能进展的关键测试,在发布仅半年后便遭遇了来自Astra模型的饱和性攻克,引发业内对AI进化节奏的重新审视。

这一消息由研究者Sherwin Wu在社交平台上披露。他曾认为ARC-AGI-3的难度足以在相当长的时间内阻挡前沿模型的前进步伐,但现实却给出了不同的答案。ARC-AGI系列基准的创造者François Chollet在回应中表示,当初发布ARC-AGI-3时,他基于此前模型能力的增长速度,预计前沿模型大约需要一年时间才能在该基准上达到饱和。然而,实际时间线被大幅压缩至6个月,这相当于其预期速度的两倍。

ARC-AGI系列测试的设计初衷,是评估模型在抽象推理与泛化能力上的表现,而非简单的知识记忆或模式匹配。ARC-AGI-3作为该系列的最新版本,其题目的设计难度和反直觉程度均有显著提升。此次被快速饱和,意味着当前模型在应对新颖、非重复性任务时的泛化能力,已经达到了一个新的量级。

Chollet进一步指出,这种超预期的进展速度具有深远意义。它意味着新一代模型的能力表现,将很可能彻底颠覆人们基于过去几年中旧有模型体验所形成的认知框架。那些曾被视作“难以逾越”的推理鸿沟,正在以比预想更快的速度被填平。对于AI行业的研究者和开发者而言,这不仅是对现有技术路线的验证,更是对下一阶段应用落地边界的重新评估。

此次事件也引发了一个更深层的讨论:当测试基准的更新速度开始跟不上模型的进化速度时,我们该如何更有效地衡量AI的真实智能水平?这或许将成为AI评估领域下一个需要攻克的课题。

ARC-AGI-3AI基准测试Astra模型通用人工智能
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词