快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期五 · 09-04 19:07 约 2 分钟读完

GPT-6 Astra 评测成绩两极分化,效率反超人类引 AGI 时间线争议

摘要

GPT-6 Astra 在 Epoch AI 与 Artificial Analysis 两项评测中得分悬殊,分别位列榜首与仅持平前代。同时,该模型在 ARC-AGI-3 上效率超过人类,促使研究者 Chollet 提前其 AGI 实现预测。

随着新一代大模型竞赛进入白热化,OpenAI 的 GPT-6 Astra 近日成为行业焦点,但不同评测体系给出的结论却大相径庭。在 Epoch AI 的榜单上,该模型以 169 分的成绩高居 267 个参评模型之首,展现出显著的技术代际优势。

然而,另一家独立评测机构 Artificial Analysis 却给出了截然不同的画像。其测评结果显示,GPT-6 Astra 仅获得 61 分,这一数字与 OpenAI 上一代模型 Sol 基本持平,并且落后于 Anthropic 的 Claude Fable 5.1 所取得的 66 分。两套基准间的巨大分差,让外界对其真实能力产生困惑。

这种分歧背后,反映出当前 AI 评测体系在任务设计、权重分配与评估维度上的深刻差异。Epoch AI 的测试可能更侧重于复杂推理与知识广度,而 Artificial Analysis 或许更关注指令遵循与实用性指标。对于开发者而言,选择何种基准作为采购参考,将直接影响对模型效能的判断。

值得关注的是,在另一项针对抽象推理的 ARC-AGI-3 测试中,GPT-6 Astra 展现出超越人类基准的效率。该测试的设计者 François Chollet 据此调整了其此前关于 AGI 实现时间的预测,认为相关技术拐点可能比原先设想的更早到来。这一表态在 AI 学界引发了关于评测有效性及 AGI 定义的新一轮讨论。

尽管评测数据存在矛盾,但业内普遍认为,GPT-6 Astra 的发布本身已标志着大模型能力边界的又一次扩展。后续随着更多第三方独立验证的落地,其真实性能画像将逐步清晰,也将为各行业的技术选型提供更可靠的依据。

GPT-6AI评测AGIOpenAI
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词