Baseten用Claude Code自动生成推理引擎,单流解码较vLLM提升九成
摘要
Baseten工程师参考MetaInfer论文,借助Claude Code为Qwen-3.6-35B-A3B(NVFP4,单张B200)自动构建推理引擎VibeQwen。实测显示,其单流解码速度比vLLM 0.25.1快90%,首token延迟从28ms降至12ms,并发32时吞吐量高出71%。
推理引擎的调优长期依赖人工经验,而Baseten的工程师尝试了一条新路径:让大模型自己动手。他们参考MetaInfer论文的方法,使用Claude Code(Fable 5)为特定模型自动生成推理引擎,最终产物被命名为VibeQwen。
目标模型是Qwen-3.6-35B-A3B,采用NVFP4量化格式,运行在单张B200上。对比基准为vLLM 0.25.1,这是当前主流的开源推理框架之一。测试覆盖了单流解码、首token延迟以及并发吞吐三个维度。
实测数据方面,VibeQwen的单流解码速度比vLLM 0.25.1高出90%;首token延迟从28ms压缩至12ms,降幅超过一半;在并发数为32的场景下,吞吐量提升71%。这些指标直接关系到交互式应用的响应体验和批量推理的吞吐成本。
该实验的意义在于验证了一条自动化生成推理引擎的可行路径:不再由工程师逐层手写优化,而是由LLM根据论文思路和硬件约束自主完成。对于需要在特定模型和芯片组合上压榨性能的团队,这提供了一种可复用的方法论参考。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗