快讯 23:38Dwarkesh Patel 对话 OpenAI 研究员 Noam Brown:聚焦多智能体系统与递归自我改进14:16海盗船推出 RS II 风扇、NAUTILUS II 处理器液冷14:12美ITC对苹果三星谷歌启动337调查,音频专利纠纷或波及AirPods 5在美销售 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期五 · 09-18 13:42 约 1 分钟读完

PrismML 发布 Bonsai 2 27B:三值量化实现 1.76 比特,内存占用不足 1/9

摘要

PrismML 推出三值量化模型 Bonsai 2 27B,基于 Qwen3.8 27B 构建,以不到 1/9 的内存占用达到基础模型 98.2% 的综合基准分数,模型大小仅 5.9GB,支持 262K 上下文,可在本地承担编程智能体等知识工作。

人工智能实验室 PrismML 在模型轻量化方向上再进一步。继今年早些时候推出微调模型 Bonsai 27B(以更低内存占用实现 Qwen3.6 27B 基础模型 95% 的性能)之后,该实验室于当地时间 27 日宣布推出三值量化版本 Bonsai 2 27B,将基础模型升级至 Qwen3.8 27B。

据 PrismML 介绍,Bonsai 2 27B 在推理、编程、视觉、长程智能体等维度的性能均有提升,以不到 1/9 的内存占用,在综合基准测试中取得基础模型 98.2% 的分数,整体表现甚至优于 Qwen3.6 27B。技术细节上,该模型采用 FP16 分组缩放的三值量化方案,每个权重的有效比特为 1.76,模型总大小为 5.9GB,支持 262K 上下文窗口。

性能数据方面,Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上实现 143TPS 的词元吞吐量,在 Apple Silicon M5 Max 上可达 46.8TPS;在 GeForce RTX 4090 上的能效为 0.714mWh / Token,比全精度 8B 模型低 40%。运行支持上,该模型可通过 CUDA 在 NVIDIA GPU 上运行,也可通过 MLX 部署。

PrismML 表示,Bonsai 2 27B 足以在本地承担编程智能体循环、计算机使用工作流、私有文档解析、多模态调试、混合编排等“真正的知识工作”,仅在需要时才调用云端 API。这一进展意味着本地部署大模型在保持较高性能的同时,内存与能效门槛进一步降低。

PrismMLBonsai 2 27B三值量化本地部署
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
41
企业落地案例
5
完整版提示词