DeepSeek 推出 V4.1-Flash:1M 上下文与 FP4 KV 缓存落地
DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,主干 552B 加 196B Engram 参数,上下文窗口达 1M。prefill 激活 8B、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 V4-Flash 的四分之一、V1 的 1/437。
DeepSeek AI 近日推出新一代多模态 MoE 模型 DeepSeek-V4.1-Flash,在架构层面引入多项针对长上下文与推理效率的优化。该模型延续 MoE 路线,并首次在命名中明确 Flash 定位,面向高吞吐、低延迟场景。
参数配置上,DeepSeek-V4.1-Flash 采用 552B 主干参数与 196B Engram 参数的组合,上下文窗口扩展至 1M token。激活策略区分 prefill 与 decode 两个阶段:prefill 阶段激活 8B 参数,decode 阶段激活 16B 参数,以在计算开销与生成质量之间取得平衡。
KV 缓存是本次更新的关键指标。官方数据显示,DeepSeek-V4.1-Flash 的全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的四分之一,并仅为 DeepSeek-V1 的 1/437。该优化依托 FP4 KV 缓存与跨层注意力复用两项技术实现。
对 AI 行业而言,1M 上下文叠加更低的 KV 缓存占用,意味着长文档、多轮对话与代码库级任务在部署成本上更具可行性。DeepSeek 此次将 FP4 精度引入 KV 缓存,也为长上下文模型的显存与带宽瓶颈提供了新的工程思路。