快讯 23:54PS2初代安全芯片MechaCon被破解,爱好者耗时四年攻克26年谜题23:47古特雷斯呼吁全球协作管控AI风险,联大高级别周将成关键节点23:07华邦电子11.2亿美元接手英飞凌NOR与F-RAM业务,飞索半导体品牌将重启 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期四 · 09-17 12:54 约 1 分钟读完

小米MiMo-V2.6强化学习训练直播公开,罗福莉披露三项能力扩展

摘要

小米MiMo大模型负责人罗福莉9月17日发文,披露MiMo-V2.6正处于强化学习中间阶段,团队扩展了计算、环境工具和Grader Compute三项能力,训练直播总花费已超125万美元,模型即将推出。

9月17日,小米MiMo大模型负责人罗福莉对外披露了团队近半年的研发动向。自今年4月开源MiMo-v2.5以来,小米在该系列模型上保持了近半年的低调,罗福莉将这段时间的投入概括为集中研究一个问题:强化学习的能力边界究竟能延伸多远。

据罗福莉介绍,MiMo-V2.6当前处于强化学习的中间阶段。围绕这一阶段,团队为模型扩展了三项能力。其一是计算层面,每步处理约20亿个Token,采用1,568个Prompt乘以16条Rollout的配置,且完全异步执行。其二是环境和工具层面,引入多任务智能体强化学习,在单次运行中混合多个框架。其三是Grader Compute,即为打分与评分过程本身增加算力,采用Agentic In-group Credit Assignment机制,包含测试案例和评分标准奖励。

罗福莉同时公开了MiMo-V2.6模型的训练直播链接。直播页面显示,该模型即将推出,而训练总花费已超过125万美元,按当前汇率约合840.3万元人民币。这一数字直观呈现了大规模强化学习训练的算力成本量级。

小米MiMo团队表示,将在接下来的几周内逐步开源上述技术细节。对于关注强化学习扩展路径的开发者而言,这或将为智能体训练中的算力分配、多框架协同与评分机制设计提供可参考的实践样本。

小米MiMo强化学习大模型
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
41
企业落地案例
5
完整版提示词