星尘智能发布SmoothRL框架,实现异步在线强化学习
摘要
星尘智能基座模型团队推出SmoothRL,一种支持异步执行的在线强化学习框架,旨在解决机器人训练中模型推理与数据采集不同步的问题,提升训练效率与实时性。
在线强化学习是机器人从交互中持续学习的关键技术,但传统同步模式要求模型推理与数据采集严格对齐,导致训练节奏受限于最慢环节。随着大模型在机器人中的应用普及,推理延迟增加,这种同步瓶颈愈发凸显。
针对此问题,星尘智能(Astribot)基座模型团队发布了SmoothRL框架,其核心创新在于支持异步执行,允许数据采集、模型推理和参数更新在时间上解耦,从而充分利用硬件资源,缩短训练周期。
据团队介绍,SmoothRL在保持算法收敛性的同时,显著提升了吞吐量。实验数据显示,在典型机器人操作任务中,SmoothRL相较同步基线方法可减少约40%的训练时间,且不牺牲策略性能。该框架还兼容主流强化学习库,便于集成到现有工作流。
这一成果对机器人社区具有实用价值:它使研究人员能够更高效地迭代策略,尤其是在需要实时反馈的灵巧操作或导航场景中。星尘智能表示,SmoothRL已在其内部机器人平台上验证,未来将考虑开源关键组件以推动行业进步。
本文由新大陆基于公开信息编辑整理
信息来源:量子位 量子位原文 ↗