实测 Mac Studio 跑 Qwen3.8 27B:Q4 量化下生成速度 14 tokens/s
摘要
开发者实测在 Mac Studio M3 Ultra 上通过 Ollama 运行 Qwen3.8 27B(27.3B 参数),采用 Q4_K_M 量化后模型体积 17GB,文本生成速度约 14 tokens/s,为本地部署大模型提供了性能参考。
近日,一位开发者分享了在 Mac Studio M3 Ultra 上本地运行 Qwen3.8 27B 的实测数据。该模型拥有 27.3B 参数,采用混合注意力架构,支持 262,144 token 的上下文窗口,并以 Apache 2.0 协议开源。测试环境为 Ollama 推理框架,量化方式选用 Q4_K_M,模型文件大小约 17GB。
实测结果显示,在该配置下,模型的文本生成速度约为每秒 14 个 token。这一数据对于需要本地部署大模型的 AI 从业者而言,提供了具体的性能参考。与云端 API 调用相比,本地运行在数据隐私和离线可用性方面具有优势,但速度受限于硬件算力。
Qwen3.8 27B 是阿里通义千问团队近期发布的开源模型,其混合注意力架构旨在平衡长上下文处理效率与推理成本。262,144 token 的上下文窗口使其能够处理超长文档或复杂对话,而 Apache 2.0 许可则允许商业使用和二次开发。
此次实测表明,在 Apple 高端桌面级芯片 M3 Ultra 上,Q4 量化后的 27B 模型可以达到基本可用的生成速度。对于追求更高吞吐量的用户,可能需要进一步降低量化精度或使用多卡方案,但当前数据已展示了单机本地运行大型语言模型的可行性。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗