快讯 23:19ARC Prize 2026 赛季揭晓:TUFA Labs 以 88.06% 领跑 ARC-AGI-2 高分榜22:52研究显示:相同AI技术下,男性形象智能体获报酬高于女性形象02:41Epoch AI 推出 InnovationEval:前沿模型复现论文创新仅达人类增益 15% 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期六 · 10-10 02:41 约 1 分钟读完

Epoch AI 推出 InnovationEval:前沿模型复现论文创新仅达人类增益 15%

摘要

Epoch AI 发布新评测 InnovationEval,用于检验 AI 独立复现机器学习论文创新的能力,对照基准为 Self-Distillation Policy Optimization(SDPO)。结果显示,前沿模型仅实现人类论文所获增益的 15%,表明当前 AI 在自主科研创新上仍存在显著差距。

AI 能否独立复现人类科研创新,正成为衡量模型能力的新标尺。Epoch AI 近日推出名为 InnovationEval 的评测,专门考察 AI 独立复现机器学习论文中创新点的水平,并以 Self-Distillation Policy Optimization(SDPO)作为对照对象。

评测结果给出了一个直观的量化差距:前沿模型所取得的增益,仅相当于人类论文中 SDPO 带来增益的 15%。这一数字意味着,尽管模型在既有任务上表现亮眼,但在自主提出并验证创新方法这一环节,距离人类研究者仍有明显距离。

InnovationEval 的设计思路,是把论文中的创新作为可复现的目标,让 AI 在无人类直接指导的条件下尝试还原。SDPO 作为对照基准,为衡量模型输出提供了参照系,也使不同模型之间的比较具备统一尺度。

对于 AI 行业而言,这一评测补充了现有基准之外的视角:模型能否从阅读论文走向独立创新,是通往自动化科研的关键一步。15% 的增益比例提示,前沿模型在创新复现上尚处早期阶段,后续进展值得持续观察。

Epoch AIInnovationEvalSDPOAI 科研
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
60
企业落地案例
11
完整版提示词