快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

DeepSeek-V4.1-Flash

深度求索 · API 定价、上下文与选型参考 · 雷达每 6 小时扫描厂商发布与调价

DeepSeek-V4.1-Flash
深度求索
已备案 ↓33% 较上代
输入价格
¥1.0/ 百万 token
输出价格
¥4.0/ 百万 token
上下文
1M
免费额度
注册赠送(按量计费)
轻量高性价比
适用场景
Agent 长会话长文档理解内容分类高并发客服
场景聚合 · Token 包参考
轻量体验包 ¥5
500 万 · 个人试用与原型验证
按闲时输入单价 ¥1.0/百万估算
常规生产包 ¥100
1 亿 · 日均千万级 token 的业务
按输入单价估算,输出另计 ¥4.0/百万
缓存优化包 ¥2
1 亿(缓存命中) · RAG / 长 System Prompt 复用
缓存命中 ¥0.02/百万,是未命中的 1/50
Token 包为按刊例价的估算参考,实际支出以用量结构为准;厂商官方资源包以购买页为准。
查看官方定价文档 ↗ 价格以厂商官网为准,本站每日核对
简介

深度求索 2026-09-10 上线 V4.1-Flash 直接替换 V4-Flash。552B 总参 MoE 非对称架构,输入侧仅 8B 激活、输出侧 16B 激活,KV Cache 占用降至上一代 1/4(HBM)与 1/8(SSD)。闲时输入 ¥1.0/百万、输出 ¥4.0/百万、缓存命中 ¥0.02/百万,高峰翻倍。官方称多项基准已超自家 V4-Pro(但 V4-Pro 的下线计划已于 9-11 撤回,两者继续并行销售)。

2026 年 9 月 10 日,深度求索上线 DeepSeek-V4.1-Flash(API 模型名 deepseek-flash)并同步下调定价。模型采用全新的 Causal Encoder–Decoder 非对称架构:总参数 552B 的 MoE,输入侧仅激活 8B、输出侧激活 16B,官方称多项基准已超过自家旗舰 V4-Pro。

这次升级的核心卖点是缓存。V4.1-Flash 的 KV Cache 对 HBM 的需求降到上一代的 1/4,对 SSD 存储的需求降到 1/8。Agent 类应用中缓存命中费用往往占账单大头,压缩缓存直接把这部分成本压了下来。

价格沿用峰谷机制,闲时价为高峰价的一半。闲时:输入缓存命中 ¥0.02/百万、未命中 ¥1.0/百万、输出 ¥4.0/百万;高峰:¥0.04 / ¥2.0 / ¥8.0(均为每百万 tokens)。高峰期指周一至周五的 9:00–12:00 与 14:00–18:00(北京时间),其余含周末为闲时。新价自 9 月 10 日 12:00 起生效。

缓存命中价与未命中价相差 50 倍,说明任何带稳定 System Prompt 或重复文档上下文的负载都应优先围绕缓存设计。上下文 1M、最大输出 384K、并发上限 2500(V4-Pro 为 500)。

迁移与下线:原 V4-Flash 与 V4-Flash-Vision-Exp 已下线,模型名 deepseek-v4-flash 暂时路由到 V4.1-Flash。至于 V4-Pro,官方 9-10 曾公告要把 v4-pro 请求全部路由到 V4.1-Flash 并按 Flash 单价计费,但 9-11 又撤回了该计划——V4-Pro 在 9 月 14 日之后继续独立提供服务、计费不变。也就是说:Flash 端的替换是确定的,Pro 端的并线没有发生。

DeepSeekV4.1-Flash分时段定价KV缓存
本文由新大陆基于公开信息编辑整理
其他模型
GLM-5.3
智谱 AI · 输入 ¥8 / 输出 ¥28
Qwen3.8-Flash
阿里云 · 输入 ¥0.15 / 输出 ¥1.5
豆包 doubao-seed-2.1-pro
字节跳动 · 输入 ¥6.0 / 输出 ¥30.0
小米 MiMo-V2.5-Pro
小米 · 输入 ¥3.0 / 输出 ¥6.0
美团 LongCat-2.0
美团 · 输入 ¥2.0 / 输出 ¥8.0
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词