Strata引擎开源:12GB显存消费级显卡可跑125B参数Qwen3.8模型
开发者Niko1221开源Strata引擎,通过MoE分层加载与投机解码技术,让12GB显存消费级显卡运行125B参数的Qwen3.8-Flash-Next模型,在RTX 5070上实现94词元/秒推理速度。
大模型推理的显存门槛正被进一步拉低。开发者Niko1221近日开源了一款名为Strata的推理引擎,目标明确:让消费级显卡也能承载千亿参数级别的混合专家模型。该引擎支持的模型为阿里巴巴Qwen团队于2026年8月推出的Qwen3.8-Flash-Next压缩版本,参数量达到125B,另含51B参数的n-gram嵌入表,原生支持262K token上下文长度。
Strata降低显存占用的思路有两处关键设计。其一,引擎将MoE模型的整体权重驻留在系统内存中,仅把高频调用的专家模块动态载入VRAM,以此规避显存容量瓶颈。其二,引擎引入轻量级模型执行投机解码,通过预测下一Token来加速推理流程,在有限算力下换取更高的生成效率。
硬件门槛方面,运行该模型的最低配置为:12GB以上VRAM的NVIDIA或AMD显卡、32GB以上系统内存、80GB以上存储空间(推荐SSD),操作系统支持Windows 10/11或Linux。在NVIDIA GeForce RTX 5070(12GB VRAM)搭配Ryzen 5 7600与64GB RAM的测试平台上,2比特量化版本Q2_0跑出了94词元/秒的推理速度。
这一方案的意义在于,它将125B级MoE模型的本地部署从专业级硬件下放至主流消费级平台。对于需要在本地环境运行大模型的开发者而言,Strata提供了一条不依赖高端加速卡的可行路径,但实际表现仍受量化精度与系统内存带宽的制约。