快讯 23:45苹果 2026 款 Mac mini 明日开售:M6 与 M5 Pro 双芯片,6999 元起23:40苹果2026款Mac Studio开售:M5 Max与Ultra双芯,19999元起23:32苹果 M6 Mac mini 首发 2nm 制程,实测对比上代性能提升 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期二 · 09-22 08:00 约 1 分钟读完

Hugging Face transformers 新增 GGUF 模型直载能力,本地推理性能逼近 llama.cpp

摘要

Hugging Face 宣布 transformers 库现已支持直接加载 GGUF 量化模型,开发者通过 from_pretrained 传入 gguf_file 参数即可调用 Hub 上的 GGUF checkpoint,并复用 ggml 的 Metal 内核,本地推理性能接近 llama.cpp。

Hugging Face 近日为其 transformers 库引入了一项新能力:直接加载并运行 GGUF 格式的量化模型。这意味着开发者不再需要借助额外的转换步骤或独立的推理框架,即可在 transformers 生态内使用 GGUF checkpoint。

具体而言,用户只需在 from_pretrained 方法中传入 gguf_file 参数,便可从 Hugging Face Hub 拉取对应的 GGUF 模型文件。该功能同时复用了 ggml 的 Metal 内核,从而在 Apple 芯片设备上获得硬件加速支持。

GGUF 是 llama.cpp 项目主推的量化模型格式,此前主要服务于 llama.cpp 自身的推理流程。此次 transformers 对 GGUF 的原生支持,使得同一份量化权重可以在两个主流工具链之间通用,减少了格式转换带来的摩擦。

从性能角度看,Hugging Face 表示该路径下的本地推理表现已接近 llama.cpp。对于需要在本地环境部署量化模型的开发者而言,这提供了一种更贴近 transformers 使用习惯的替代方案,同时也进一步模糊了训练/微调框架与轻量推理引擎之间的边界。

Hugging FacetransformersGGUF量化模型
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
45
企业落地案例
5
完整版提示词