Fireworks 发布 DeepSeek-V4.1-Flash 评测:DeepSWE 追平 GPT-6 Astra,单任务成本降至十五分之一
摘要
Fireworks 公布 DeepSeek-V4.1-Flash 完整基准结果。该模型在 DeepSWE 上以 max 档取得 74.34% pass@1,与 GPT-6 Astra 处于同一水平,但每任务成本仅 0.43 美元,约为后者的 1/15,凸显推理成本差距。
Fireworks 近日发布 DeepSeek-V4.1-Flash,并同步公开了该模型的完整基准测试结果,重点展示其在软件工程类任务上的表现与成本结构。
根据官方数据,DeepSeek-V4.1-Flash 在 DeepSWE 基准上以 max 档运行,取得 74.34% 的 pass@1 成绩。Fireworks 表示,这一结果与 GPT-6 Astra 处于同一水平。
成本层面的差异更为显著。Fireworks 公布的数据显示,DeepSeek-V4.1-Flash 每任务成本为 0.43 美元,约为 GPT-6 Astra 的 1/15。
对于关注推理经济性的 AI 行业从业者而言,这一组合意味着在 DeepSWE 这类任务上,接近前沿水平的通过率不再必然对应同等量级的单任务开销。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗