快讯 23:46Anthropic 拟登陆纳斯达克,连续两季盈利目标估值 2 万亿美元23:06英伟达联手 Perplexity:本地智能体 Portable Computer 登陆 Windows RTX PC23:05X与SpaceXAI撤回对苹果反垄断诉讼,继续追责OpenAI 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 昨天 · 星期一 · 09-14 08:00 约 1 分钟读完

Hugging Face 推异步 GRPO 方案:LoRA 加持,训练推理解耦提速 3.9 倍

摘要

Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中支持仅训练和同步 LoRA adapter,结合 Storage Bucket 挂载与代理路由,使训练 Job 与 vLLM 推理 Job 可跨机器运行且无需 NCCL,实测提速 3.9 倍。

Hugging Face 近日公布了一项针对异步 GRPO 训练的效率优化方案,相关能力已集成在 TRL v1.14 版本的 AsyncGRPOTrainer 中。该方案的核心思路是打破传统训练与推理必须同机部署的限制,为强化学习训练流程提供更灵活的资源配置方式。

具体而言,AsyncGRPOTrainer 现在支持只对 LoRA adapter 进行训练和同步,而非全量模型参数。与此同时,Hugging Face 引入 Storage Bucket 挂载与代理路由机制,让训练 Job 和 vLLM 推理 Job 可以分别运行在不同机器上,且整个流程无需依赖 NCCL 通信。

这一架构调整带来的直接收益是性能提升。根据 Hugging Face 披露的数据,该方案在实测中实现了 3.9 倍的提速。对于需要频繁在训练与推理之间切换的 GRPO 类工作负载来说,跨机解耦意味着资源调度不再受限于单机拓扑。

从行业视角看,该方案降低了异步强化学习训练对高速互联的依赖,LoRA 的引入也进一步压缩了同步开销。相关代码与配置已随 TRL v1.14 发布,开发者可直接在 HF Jobs 上尝试这一组合。

Hugging FaceTRLGRPOLoRA
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
41
企业落地案例
4
完整版提示词