Hugging Face 推异步 GRPO 方案:LoRA 加持,训练推理解耦提速 3.9 倍
摘要
Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中支持仅训练和同步 LoRA adapter,结合 Storage Bucket 挂载与代理路由,使训练 Job 与 vLLM 推理 Job 可跨机器运行且无需 NCCL,实测提速 3.9 倍。
Hugging Face 近日公布了一项针对异步 GRPO 训练的效率优化方案,相关能力已集成在 TRL v1.14 版本的 AsyncGRPOTrainer 中。该方案的核心思路是打破传统训练与推理必须同机部署的限制,为强化学习训练流程提供更灵活的资源配置方式。
具体而言,AsyncGRPOTrainer 现在支持只对 LoRA adapter 进行训练和同步,而非全量模型参数。与此同时,Hugging Face 引入 Storage Bucket 挂载与代理路由机制,让训练 Job 和 vLLM 推理 Job 可以分别运行在不同机器上,且整个流程无需依赖 NCCL 通信。
这一架构调整带来的直接收益是性能提升。根据 Hugging Face 披露的数据,该方案在实测中实现了 3.9 倍的提速。对于需要频繁在训练与推理之间切换的 GRPO 类工作负载来说,跨机解耦意味着资源调度不再受限于单机拓扑。
从行业视角看,该方案降低了异步强化学习训练对高速互联的依赖,LoRA 的引入也进一步压缩了同步开销。相关代码与配置已随 TRL v1.14 发布,开发者可直接在 HF Jobs 上尝试这一组合。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗