小米MiMo-V2.6强化学习训练直播公开,罗福莉披露三项能力扩展
摘要
小米MiMo大模型负责人罗福莉9月17日发文,披露MiMo-V2.6正处于强化学习中间阶段,团队扩展了计算、环境工具和Grader Compute三项能力,训练直播总花费已超125万美元,模型即将推出。
9月17日,小米MiMo大模型负责人罗福莉对外披露了团队近半年的研发动向。自今年4月开源MiMo-v2.5以来,小米在该系列模型上保持了近半年的低调,罗福莉将这段时间的投入概括为集中研究一个问题:强化学习的能力边界究竟能延伸多远。
据罗福莉介绍,MiMo-V2.6当前处于强化学习的中间阶段。围绕这一阶段,团队为模型扩展了三项能力。其一是计算层面,每步处理约20亿个Token,采用1,568个Prompt乘以16条Rollout的配置,且完全异步执行。其二是环境和工具层面,引入多任务智能体强化学习,在单次运行中混合多个框架。其三是Grader Compute,即为打分与评分过程本身增加算力,采用Agentic In-group Credit Assignment机制,包含测试案例和评分标准奖励。
罗福莉同时公开了MiMo-V2.6模型的训练直播链接。直播页面显示,该模型即将推出,而训练总花费已超过125万美元,按当前汇率约合840.3万元人民币。这一数字直观呈现了大规模强化学习训练的算力成本量级。
小米MiMo团队表示,将在接下来的几周内逐步开源上述技术细节。对于关注强化学习扩展路径的开发者而言,这或将为智能体训练中的算力分配、多框架协同与评分机制设计提供可参考的实践样本。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗