小米复盘MiMo-V2.6工具调用重复问题,MOPD方案将修复成本压缩至MixRL的4%
摘要
小米官方复盘MiMo-V2.6发布后出现的工具调用重复问题,响应级重复率超0.05%。回放RL各checkpoint发现调用泛滥率随训练从11.1%升至24.6%,直接调低阈值需重启20步MixRL,成本约231万美元,而采用MOPD方案将修复成本降至前者的4%。
小米近日对其大模型MiMo-V2.6发布后暴露的工具调用重复问题进行了官方复盘。团队在分析中明确区分了三种行为:正常的并行调用、调用泛滥以及调用重复,并指出响应级重复率已超过0.05%,构成需要干预的异常信号。
通过对强化学习训练过程中各checkpoint的回放,小米发现调用泛滥率随训练推进持续攀升,从11.1%上升至24.6%。团队判断,32次调用阈值的惩罚力度过于宽松,是导致该指标恶化的直接原因。
然而,直接调低阈值并非低成本操作。小米估算,若重启20步MixRL训练,成本约为231万美元,而内部测试显示重复率仅能从13.45%降至3.83%,投入产出比并不理想。
为此,小米转向MOPD方案,将修复成本压低至MixRL方案的4%。这一结果为大模型工具调用行为的训练后修复提供了一条更具经济性的路径,也提示阈值设计与惩罚机制需在训练早期同步校准。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗