GPT-6 Astra 评测成绩两极分化,效率反超人类引 AGI 时间线争议
GPT-6 Astra 在 Epoch AI 与 Artificial Analysis 两项评测中得分悬殊,分别位列榜首与仅持平前代。同时,该模型在 ARC-AGI-3 上效率超过人类,促使研究者 Chollet 提前其 AGI 实现预测。
随着新一代大模型竞赛进入白热化,OpenAI 的 GPT-6 Astra 近日成为行业焦点,但不同评测体系给出的结论却大相径庭。在 Epoch AI 的榜单上,该模型以 169 分的成绩高居 267 个参评模型之首,展现出显著的技术代际优势。
然而,另一家独立评测机构 Artificial Analysis 却给出了截然不同的画像。其测评结果显示,GPT-6 Astra 仅获得 61 分,这一数字与 OpenAI 上一代模型 Sol 基本持平,并且落后于 Anthropic 的 Claude Fable 5.1 所取得的 66 分。两套基准间的巨大分差,让外界对其真实能力产生困惑。
这种分歧背后,反映出当前 AI 评测体系在任务设计、权重分配与评估维度上的深刻差异。Epoch AI 的测试可能更侧重于复杂推理与知识广度,而 Artificial Analysis 或许更关注指令遵循与实用性指标。对于开发者而言,选择何种基准作为采购参考,将直接影响对模型效能的判断。
值得关注的是,在另一项针对抽象推理的 ARC-AGI-3 测试中,GPT-6 Astra 展现出超越人类基准的效率。该测试的设计者 François Chollet 据此调整了其此前关于 AGI 实现时间的预测,认为相关技术拐点可能比原先设想的更早到来。这一表态在 AI 学界引发了关于评测有效性及 AGI 定义的新一轮讨论。
尽管评测数据存在矛盾,但业内普遍认为,GPT-6 Astra 的发布本身已标志着大模型能力边界的又一次扩展。后续随着更多第三方独立验证的落地,其真实性能画像将逐步清晰,也将为各行业的技术选型提供更可靠的依据。