快讯 23:20DeepSeek V4.1 Flash 在 ARC-AGI 评测中得分大幅提升,但成本增加约 250%22:49《明日方舟:终末地》宣布适配英伟达 RTX Spark 笔记本,丹青渡版本前瞻公布22:30AMD股价盘中创历史新高,苏姿丰称AI芯片供不应求将扩产 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期三 · 10-07 23:20 约 1 分钟读完

DeepSeek V4.1 Flash 在 ARC-AGI 评测中得分大幅提升,但成本增加约 250%

摘要

ARC Prize 公布 DeepSeek V4.1 Flash 在 ARC-AGI (Verified) 的评测结果:ARC-AGI-2 得分 72.9%,每任务成本 0.13 美元;ARC-AGI-1 得分 94.5%,每任务成本 0.07 美元。相比 V4 Flash 最佳成绩,两项得分分别提高 5.5 分和 11.5 分,但每任务成本高出约 250%。

ARC Prize 近日公布了 DeepSeek V4.1 Flash 在 ARC-AGI (Verified) 基准测试中的成绩。该评测旨在衡量 AI 模型在抽象推理任务上的表现,此次公布的数据涵盖了 ARC-AGI-1 和 ARC-AGI-2 两个版本。

具体来看,DeepSeek V4.1 Flash 在 ARC-AGI-2 上获得 72.9% 的得分,每任务成本为 0.13 美元;在 ARC-AGI-1 上得分 94.5%,每任务成本 0.07 美元。这两个成绩均来自 ARC Prize 的官方验证。

与 DeepSeek V4 Flash 的最佳成绩相比,V4.1 Flash 在 ARC-AGI-1 上高出 5.5 分,在 ARC-AGI-2 上高出 11.5 分。然而,性能提升的同时,每任务成本也增加了约 250%。

此次成绩表明 DeepSeek V4.1 Flash 在抽象推理能力上取得了显著进步,但成本上升可能影响其在对成本敏感场景中的部署。ARC-AGI 系列评测因其对通用推理能力的严格考察,一直被视为衡量 AI 模型智能水平的重要参考。

DeepSeekARC-AGI基准测试AI推理
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
60
企业落地案例
10
完整版提示词