快讯 23:58OpenAI 欧盟上线 textGrain 隐形水印,ChatGPT 与 Codex 文本输出将可被机器识别23:01OpenAI 在 ChatGPT 内测图片广告,覆盖 12 亿周活用户23:00OpenAI推出textGrain文本水印方案,应对欧盟AI法案合规要求 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期二 · 10-06 15:45 约 2 分钟读完

Strata引擎开源:12GB显存消费级显卡可跑125B参数Qwen3.8模型

摘要

开发者Niko1221开源Strata引擎,通过MoE分层加载与投机解码技术,让12GB显存消费级显卡运行125B参数的Qwen3.8-Flash-Next模型,在RTX 5070上实现94词元/秒推理速度。

大模型推理的显存门槛正被进一步拉低。开发者Niko1221近日开源了一款名为Strata的推理引擎,目标明确:让消费级显卡也能承载千亿参数级别的混合专家模型。该引擎支持的模型为阿里巴巴Qwen团队于2026年8月推出的Qwen3.8-Flash-Next压缩版本,参数量达到125B,另含51B参数的n-gram嵌入表,原生支持262K token上下文长度。

Strata降低显存占用的思路有两处关键设计。其一,引擎将MoE模型的整体权重驻留在系统内存中,仅把高频调用的专家模块动态载入VRAM,以此规避显存容量瓶颈。其二,引擎引入轻量级模型执行投机解码,通过预测下一Token来加速推理流程,在有限算力下换取更高的生成效率。

硬件门槛方面,运行该模型的最低配置为:12GB以上VRAM的NVIDIA或AMD显卡、32GB以上系统内存、80GB以上存储空间(推荐SSD),操作系统支持Windows 10/11或Linux。在NVIDIA GeForce RTX 5070(12GB VRAM)搭配Ryzen 5 7600与64GB RAM的测试平台上,2比特量化版本Q2_0跑出了94词元/秒的推理速度。

这一方案的意义在于,它将125B级MoE模型的本地部署从专业级硬件下放至主流消费级平台。对于需要在本地环境运行大模型的开发者而言,Strata提供了一条不依赖高端加速卡的可行路径,但实际表现仍受量化精度与系统内存带宽的制约。

StrataQwen3.8MoE推理消费级显卡
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
60
企业落地案例
10
完整版提示词