小米 MiMo-V3 架构升级:HySparse 2 发布,1M 上下文预填充算力降 5 倍
小米 MiMo 大模型负责人罗福莉宣布 MiMo-V3 将采用全新架构,核心组件 HySparse 2 于 9 月 23 日发布。该架构在 1M Token 长度下将预填充计算量降低 5.02 倍、KV 缓存缩小 4.5 倍,并提升长上下文检索评分,针对智能体推理场景优化。
9 月 23 日,小米 MiMo 大模型负责人罗福莉通过社交平台宣布,MiMo-V3 即将切换至一套全新架构,其核心组件 HySparse 2 于同日正式发布。该方案围绕智能体推理场景展开设计,目标是在长上下文条件下同时压低预填充成本、KV 缓存占用与检索误差。
罗福莉指出,智能体推理与常规推理存在本质差异:每一轮交互中,一个简短动作可能触发长文本观察结果,这些内容需要重新预填充,而上下文仍在持续膨胀。由此,预填充成本、KV 缓存大小和检索准确率被同时推上关键路径,成为制约效率的核心变量。
HySparse 2 给出的量化结果包括:在 1M(100 万)Token 长度下,预填充计算量(FLOPs)降低 5.02 倍,KV 缓存缩小 4.5 倍;同时 MRCRv2 与 RULER-v2 评分更高,AgentPPL 和 LongPPL 更低。这意味着模型在长上下文检索质量与困惑度指标上均获得改善。
架构层面,HySparse 2 引入两项关键机制。其一是 KV 桥接(KV Bridging),遵循 YOCO 思路,交叉解码器中的全注意力层利用自解码器的隐藏状态构建 K/V;其二是 KV 重用(KV Reuse),在每个混合块内,稀疏层复用前一层全注意力层的 KV 缓存与选择索引。此外,方案将选择粒度从块级别调整为 Token 级别,并以近期 Token 的强制窗口替代独立的 SWA 分支,使本地与全局 Token 共享同一 KV 缓存。由于所有交叉解码器 KV 缓存均来自自解码器,该设计进一步简化了缓存来源。