快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期五 · 09-04 17:19 约 1 分钟读完

星尘智能发布SmoothRL框架,实现异步在线强化学习

摘要

星尘智能基座模型团队推出SmoothRL,一种支持异步执行的在线强化学习框架,旨在解决机器人训练中模型推理与数据采集不同步的问题,提升训练效率与实时性。

在线强化学习是机器人从交互中持续学习的关键技术,但传统同步模式要求模型推理与数据采集严格对齐,导致训练节奏受限于最慢环节。随着大模型在机器人中的应用普及,推理延迟增加,这种同步瓶颈愈发凸显。

针对此问题,星尘智能(Astribot)基座模型团队发布了SmoothRL框架,其核心创新在于支持异步执行,允许数据采集、模型推理和参数更新在时间上解耦,从而充分利用硬件资源,缩短训练周期。

据团队介绍,SmoothRL在保持算法收敛性的同时,显著提升了吞吐量。实验数据显示,在典型机器人操作任务中,SmoothRL相较同步基线方法可减少约40%的训练时间,且不牺牲策略性能。该框架还兼容主流强化学习库,便于集成到现有工作流。

这一成果对机器人社区具有实用价值:它使研究人员能够更高效地迭代策略,尤其是在需要实时反馈的灵巧操作或导航场景中。星尘智能表示,SmoothRL已在其内部机器人平台上验证,未来将考虑开源关键组件以推动行业进步。

在线强化学习机器人异步框架星尘智能
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词