Epoch AI 推出 InnovationEval:前沿模型复现论文创新仅达人类增益 15%
摘要
Epoch AI 发布新评测 InnovationEval,用于检验 AI 独立复现机器学习论文创新的能力,对照基准为 Self-Distillation Policy Optimization(SDPO)。结果显示,前沿模型仅实现人类论文所获增益的 15%,表明当前 AI 在自主科研创新上仍存在显著差距。
AI 能否独立复现人类科研创新,正成为衡量模型能力的新标尺。Epoch AI 近日推出名为 InnovationEval 的评测,专门考察 AI 独立复现机器学习论文中创新点的水平,并以 Self-Distillation Policy Optimization(SDPO)作为对照对象。
评测结果给出了一个直观的量化差距:前沿模型所取得的增益,仅相当于人类论文中 SDPO 带来增益的 15%。这一数字意味着,尽管模型在既有任务上表现亮眼,但在自主提出并验证创新方法这一环节,距离人类研究者仍有明显距离。
InnovationEval 的设计思路,是把论文中的创新作为可复现的目标,让 AI 在无人类直接指导的条件下尝试还原。SDPO 作为对照基准,为衡量模型输出提供了参照系,也使不同模型之间的比较具备统一尺度。
对于 AI 行业而言,这一评测补充了现有基准之外的视角:模型能否从阅读论文走向独立创新,是通往自动化科研的关键一步。15% 的增益比例提示,前沿模型在创新复现上尚处早期阶段,后续进展值得持续观察。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗