DeepSeek V4.1 Flash 在 ARC-AGI 评测中得分大幅提升,但成本增加约 250%
摘要
ARC Prize 公布 DeepSeek V4.1 Flash 在 ARC-AGI (Verified) 的评测结果:ARC-AGI-2 得分 72.9%,每任务成本 0.13 美元;ARC-AGI-1 得分 94.5%,每任务成本 0.07 美元。相比 V4 Flash 最佳成绩,两项得分分别提高 5.5 分和 11.5 分,但每任务成本高出约 250%。
ARC Prize 近日公布了 DeepSeek V4.1 Flash 在 ARC-AGI (Verified) 基准测试中的成绩。该评测旨在衡量 AI 模型在抽象推理任务上的表现,此次公布的数据涵盖了 ARC-AGI-1 和 ARC-AGI-2 两个版本。
具体来看,DeepSeek V4.1 Flash 在 ARC-AGI-2 上获得 72.9% 的得分,每任务成本为 0.13 美元;在 ARC-AGI-1 上得分 94.5%,每任务成本 0.07 美元。这两个成绩均来自 ARC Prize 的官方验证。
与 DeepSeek V4 Flash 的最佳成绩相比,V4.1 Flash 在 ARC-AGI-1 上高出 5.5 分,在 ARC-AGI-2 上高出 11.5 分。然而,性能提升的同时,每任务成本也增加了约 250%。
此次成绩表明 DeepSeek V4.1 Flash 在抽象推理能力上取得了显著进步,但成本上升可能影响其在对成本敏感场景中的部署。ARC-AGI 系列评测因其对通用推理能力的严格考察,一直被视为衡量 AI 模型智能水平的重要参考。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗