vLLM 公布 DeepSeek-V4.1-Flash 优化细节:Agent 场景吞吐提升 5.3 倍
摘要
Inferact 与 vLLM 社区在 DeepSeek-V4.1-Flash 发布三周内完成推理优化,低并发场景速度提升 1.9 倍,在 150 TPS 约束下吞吐提升 5.3 倍,重点面向 Agent 场景。
DeepSeek-V4.1-Flash 发布后不久,推理框架 vLLM 便针对该模型展开专项优化。据 vLLM 方面披露,此次工作由 Inferact 与 vLLM 社区共同推进,从模型发布到优化落地仅用时三周。
优化效果体现在两个维度:在低并发条件下,推理速度提升至原来的 1.9 倍;而在 150 TPS 的吞吐约束下,整体吞吐量提升达 5.3 倍。这一差异说明优化对高负载场景的收益更为显著。
从场景定位看,此次优化主要面向 Agent 类应用。Agent 场景通常涉及多轮调用、工具交互与并发请求,对推理框架的吞吐和延迟均有较高要求,vLLM 的优化方向与这类负载特征直接相关。
对于依赖 DeepSeek-V4.1-Flash 构建 Agent 服务的开发者而言,此次优化意味着在相同硬件条件下可承载更高请求量,或在满足既定吞吐目标时降低资源占用。相关优化已随 vLLM 社区版本推进落地。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗