深度求索 2026-09-10 上线 V4.1-Flash 直接替换 V4-Flash。552B 总参 MoE 非对称架构,输入侧仅 8B 激活、输出侧 16B 激活,KV Cache 占用降至上一代 1/4(HBM)与 1/8(SSD)。闲时输入 ¥1.0/百万、输出 ¥4.0/百万、缓存命中 ¥0.02/百万,高峰翻倍。官方称多项基准已超自家 V4-Pro(但 V4-Pro 的下线计划已于 9-11 撤回,两者继续并行销售)。
2026 年 9 月 10 日,深度求索上线 DeepSeek-V4.1-Flash(API 模型名 deepseek-flash)并同步下调定价。模型采用全新的 Causal Encoder–Decoder 非对称架构:总参数 552B 的 MoE,输入侧仅激活 8B、输出侧激活 16B,官方称多项基准已超过自家旗舰 V4-Pro。
这次升级的核心卖点是缓存。V4.1-Flash 的 KV Cache 对 HBM 的需求降到上一代的 1/4,对 SSD 存储的需求降到 1/8。Agent 类应用中缓存命中费用往往占账单大头,压缩缓存直接把这部分成本压了下来。
价格沿用峰谷机制,闲时价为高峰价的一半。闲时:输入缓存命中 ¥0.02/百万、未命中 ¥1.0/百万、输出 ¥4.0/百万;高峰:¥0.04 / ¥2.0 / ¥8.0(均为每百万 tokens)。高峰期指周一至周五的 9:00–12:00 与 14:00–18:00(北京时间),其余含周末为闲时。新价自 9 月 10 日 12:00 起生效。
缓存命中价与未命中价相差 50 倍,说明任何带稳定 System Prompt 或重复文档上下文的负载都应优先围绕缓存设计。上下文 1M、最大输出 384K、并发上限 2500(V4-Pro 为 500)。
迁移与下线:原 V4-Flash 与 V4-Flash-Vision-Exp 已下线,模型名 deepseek-v4-flash 暂时路由到 V4.1-Flash。至于 V4-Pro,官方 9-10 曾公告要把 v4-pro 请求全部路由到 V4.1-Flash 并按 Flash 单价计费,但 9-11 又撤回了该计划——V4-Pro 在 9 月 14 日之后继续独立提供服务、计费不变。也就是说:Flash 端的替换是确定的,Pro 端的并线没有发生。