快讯 23:36AMD未发布锐龙9 5900X3D工程样品曝光:12核配32MB+96MB L3缓存16:00Ai2开源8B科学报告生成模型AstaBrief,已上线Asta平台08:00Epoch AI 测算:2025至2027年HBM产能可承载千万级并发前沿智能体 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期六 · 10-03 05:09 约 1 分钟读完

Baseten用Claude Code自动生成推理引擎,单流解码较vLLM提升九成

摘要

Baseten工程师参考MetaInfer论文,借助Claude Code为Qwen-3.6-35B-A3B(NVFP4,单张B200)自动构建推理引擎VibeQwen。实测显示,其单流解码速度比vLLM 0.25.1快90%,首token延迟从28ms降至12ms,并发32时吞吐量高出71%。

推理引擎的调优长期依赖人工经验,而Baseten的工程师尝试了一条新路径:让大模型自己动手。他们参考MetaInfer论文的方法,使用Claude Code(Fable 5)为特定模型自动生成推理引擎,最终产物被命名为VibeQwen。

目标模型是Qwen-3.6-35B-A3B,采用NVFP4量化格式,运行在单张B200上。对比基准为vLLM 0.25.1,这是当前主流的开源推理框架之一。测试覆盖了单流解码、首token延迟以及并发吞吐三个维度。

实测数据方面,VibeQwen的单流解码速度比vLLM 0.25.1高出90%;首token延迟从28ms压缩至12ms,降幅超过一半;在并发数为32的场景下,吞吐量提升71%。这些指标直接关系到交互式应用的响应体验和批量推理的吞吐成本。

该实验的意义在于验证了一条自动化生成推理引擎的可行路径:不再由工程师逐层手写优化,而是由LLM根据论文思路和硬件约束自主完成。对于需要在特定模型和芯片组合上压榨性能的团队,这提供了一种可复用的方法论参考。

Baseten推理引擎vLLMClaude Code
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
57
企业落地案例
9
完整版提示词