Hugging Face transformers 新增 GGUF 模型直载能力,本地推理性能逼近 llama.cpp
摘要
Hugging Face 宣布 transformers 库现已支持直接加载 GGUF 量化模型,开发者通过 from_pretrained 传入 gguf_file 参数即可调用 Hub 上的 GGUF checkpoint,并复用 ggml 的 Metal 内核,本地推理性能接近 llama.cpp。
Hugging Face 近日为其 transformers 库引入了一项新能力:直接加载并运行 GGUF 格式的量化模型。这意味着开发者不再需要借助额外的转换步骤或独立的推理框架,即可在 transformers 生态内使用 GGUF checkpoint。
具体而言,用户只需在 from_pretrained 方法中传入 gguf_file 参数,便可从 Hugging Face Hub 拉取对应的 GGUF 模型文件。该功能同时复用了 ggml 的 Metal 内核,从而在 Apple 芯片设备上获得硬件加速支持。
GGUF 是 llama.cpp 项目主推的量化模型格式,此前主要服务于 llama.cpp 自身的推理流程。此次 transformers 对 GGUF 的原生支持,使得同一份量化权重可以在两个主流工具链之间通用,减少了格式转换带来的摩擦。
从性能角度看,Hugging Face 表示该路径下的本地推理表现已接近 llama.cpp。对于需要在本地环境部署量化模型的开发者而言,这提供了一种更贴近 transformers 使用习惯的替代方案,同时也进一步模糊了训练/微调框架与轻量推理引擎之间的边界。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗