快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期一 · 08-31 15:00 约 1 分钟读完

实测 Mac Studio 跑 Qwen3.8 27B:Q4 量化下生成速度 14 tokens/s

摘要

开发者实测在 Mac Studio M3 Ultra 上通过 Ollama 运行 Qwen3.8 27B(27.3B 参数),采用 Q4_K_M 量化后模型体积 17GB,文本生成速度约 14 tokens/s,为本地部署大模型提供了性能参考。

近日,一位开发者分享了在 Mac Studio M3 Ultra 上本地运行 Qwen3.8 27B 的实测数据。该模型拥有 27.3B 参数,采用混合注意力架构,支持 262,144 token 的上下文窗口,并以 Apache 2.0 协议开源。测试环境为 Ollama 推理框架,量化方式选用 Q4_K_M,模型文件大小约 17GB。

实测结果显示,在该配置下,模型的文本生成速度约为每秒 14 个 token。这一数据对于需要本地部署大模型的 AI 从业者而言,提供了具体的性能参考。与云端 API 调用相比,本地运行在数据隐私和离线可用性方面具有优势,但速度受限于硬件算力。

Qwen3.8 27B 是阿里通义千问团队近期发布的开源模型,其混合注意力架构旨在平衡长上下文处理效率与推理成本。262,144 token 的上下文窗口使其能够处理超长文档或复杂对话,而 Apache 2.0 许可则允许商业使用和二次开发。

此次实测表明,在 Apple 高端桌面级芯片 M3 Ultra 上,Q4 量化后的 27B 模型可以达到基本可用的生成速度。对于追求更高吞吐量的用户,可能需要进一步降低量化精度或使用多卡方案,但当前数据已展示了单机本地运行大型语言模型的可行性。

Qwen3.8Mac Studio本地部署Ollama
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词