DeepSeek V4.1 Flash 登陆国家超算互联网,552B MoE 模型成本大幅下探
DeepSeek V4.1 Flash 模型于 9 月 10 日上线国家超算互联网中心,用户可通过官网模型服务页面调用 API。该模型为 552B 参数 MoE 架构,采用 Causal-Encoder-Decoder 结构,输入激活仅 8B、输出激活 16B,基准测试超越 DeepSeek V4 Pro,并将 KV Cache 对 HBM 和 SSD 的需求分别降至上一代的 1/4 和 1/8。
9 月 10 日,DeepSeek V4.1 Flash 模型正式上线国家超算互联网中心。用户登录国家超算互联网官网后,从首页进入「模型服务」页面,即可直接打开该模型的 API 调用界面,接入流程较为便捷。
从技术规格来看,DeepSeek V4.1 Flash 是一款 552B 参数的 MoE 模型,采用了全新的 Causal-Encoder-Decoder 结构。其输入与输出呈现不对称特征:输入激活仅为 8B,输出激活为 16B,官方称其成本显著低于已知的同尺寸模型。这一设计意味着模型在推理过程中实际调用的参数量远低于总参数量,从而在保持能力的同时压缩了计算开销。
在训练层面,V4.1 Flash 引入了新的预训练方式,并经过更大规模的强化学习后训练。基准测试结果显示,该模型的智能水平成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型,表明其在能力上并未因成本优化而妥协。
缓存优化是此次发布的另一重点。DeepSeek V4.1 Flash 大幅缩减了 KV Cache 缓存大小,与上一代模型相比,对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8。在 Agent 使用场景中,缓存命中的费用通常占比较高,KV Cache 的压缩直接降低了 Agent 类任务的使用成本,对高频调用缓存的开发者而言具有实际意义。