DeepSeek V4.1 Flash 发布:552B MoE 架构,智能超越 V4 Pro
深度求索发布 DeepSeek V4.1 Flash,采用 552B 参数 MoE 与 Causal-Encoder-Decoder 结构,输入激活仅 8B、输出 16B,基准测试智能水平超越 V4 Pro。KV Cache 压缩显著,HBM 需求降至 1/4、SSD 降至 1/8,Agent 任务成本大幅下降,API 定价同步下调。
9 月 10 日,深度求索正式推出 DeepSeek V4.1 Flash 模型。该模型隶属其全新模型结构系列,是其中尺寸最小的一款,具备原生多模态视觉理解能力。官方表示,新结构的设计目标涵盖更高的能力上限、更快的推理速度、更大的吞吐量,以及可扩展至更大参数规模。
据披露,DeepSeek V4.1 Flash 为 552B 参数的 MoE 模型,采用全新的 Causal-Encoder-Decoder 结构。其输入与输出不对称:输入激活仅 8B,输出激活为 16B,成本显著低于已知的同尺寸模型。该模型还引入新的预训练方式,并经过更大规模的强化学习后训练。在基准测试中,其智能水平成功超越包括 DeepSeek V4 Pro 在内的一众旗舰模型。
在工程优化层面,新一代模型大幅压缩了 KV Cache 缓存大小。与上一代模型相比,对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8。官方指出,在 Agent 使用场景中,缓存命中的费用往往占比较高,对 KV Cache 的压缩可显著降低 Agent 类任务的使用成本。数据显示,相对于初代模型,其 KV Cache 已缩减至原来的 1/437。
伴随此次发布,DeepSeek V4.1 Flash 的 API 定价同步下调。对于 AI 行业从业者而言,该模型在智能水平与成本控制之间提供了新的选择,尤其是 Agent 类应用的部署门槛有望进一步降低。