快讯 23:46Anthropic 拟登陆纳斯达克,连续两季盈利目标估值 2 万亿美元23:06英伟达联手 Perplexity:本地智能体 Portable Computer 登陆 Windows RTX PC23:05X与SpaceXAI撤回对苹果反垄断诉讼,继续追责OpenAI 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期二 · 09-15 08:36 约 1 分钟读完

Fireworks 发布 DeepSeek-V4.1-Flash 评测:DeepSWE 追平 GPT-6 Astra,单任务成本降至十五分之一

摘要

Fireworks 公布 DeepSeek-V4.1-Flash 完整基准结果。该模型在 DeepSWE 上以 max 档取得 74.34% pass@1,与 GPT-6 Astra 处于同一水平,但每任务成本仅 0.43 美元,约为后者的 1/15,凸显推理成本差距。

Fireworks 近日发布 DeepSeek-V4.1-Flash,并同步公开了该模型的完整基准测试结果,重点展示其在软件工程类任务上的表现与成本结构。

根据官方数据,DeepSeek-V4.1-Flash 在 DeepSWE 基准上以 max 档运行,取得 74.34% 的 pass@1 成绩。Fireworks 表示,这一结果与 GPT-6 Astra 处于同一水平。

成本层面的差异更为显著。Fireworks 公布的数据显示,DeepSeek-V4.1-Flash 每任务成本为 0.43 美元,约为 GPT-6 Astra 的 1/15。

对于关注推理经济性的 AI 行业从业者而言,这一组合意味着在 DeepSWE 这类任务上,接近前沿水平的通过率不再必然对应同等量级的单任务开销。

DeepSeek-V4.1-FlashFireworksDeepSWEGPT-6 Astra
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
41
企业落地案例
4
完整版提示词