快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期四 · 09-10 15:31 约 1 分钟读完

DeepSeek 推出 V4.1-Flash:1M 上下文与 FP4 KV 缓存落地

摘要

DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,主干 552B 加 196B Engram 参数,上下文窗口达 1M。prefill 激活 8B、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 V4-Flash 的四分之一、V1 的 1/437。

DeepSeek AI 近日推出新一代多模态 MoE 模型 DeepSeek-V4.1-Flash,在架构层面引入多项针对长上下文与推理效率的优化。该模型延续 MoE 路线,并首次在命名中明确 Flash 定位,面向高吞吐、低延迟场景。

参数配置上,DeepSeek-V4.1-Flash 采用 552B 主干参数与 196B Engram 参数的组合,上下文窗口扩展至 1M token。激活策略区分 prefill 与 decode 两个阶段:prefill 阶段激活 8B 参数,decode 阶段激活 16B 参数,以在计算开销与生成质量之间取得平衡。

KV 缓存是本次更新的关键指标。官方数据显示,DeepSeek-V4.1-Flash 的全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的四分之一,并仅为 DeepSeek-V1 的 1/437。该优化依托 FP4 KV 缓存与跨层注意力复用两项技术实现。

对 AI 行业而言,1M 上下文叠加更低的 KV 缓存占用,意味着长文档、多轮对话与代码库级任务在部署成本上更具可行性。DeepSeek 此次将 FP4 精度引入 KV 缓存,也为长上下文模型的显存与带宽瓶颈提供了新的工程思路。

DeepSeekMoE长上下文KV 缓存
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词