小米公开 MiMo-V3 核心架构 HySparse2,优化长程 Agent 推理效率
小米 9 月 24 日公开 MiMo-V3 核心架构 HySparse2,面向长程多轮 Agent 场景,通过升级 KV 共享与稀疏选择机制,降低 Prefill 计算量与 KV Cache 占用,提升长上下文检索精度。该架构继承自 MiMo-V2 系列的 Hybrid SWA 混合注意力路线,是继 HySparse 之后的又一步探索。
小米于 9 月 24 日对外披露了其下一代模型 MiMo-V3 的核心架构 HySparse2。该架构定位面向长程多轮 Agent 任务,目标是在处理网页、文件、代码以及工具调用记录等长上下文输入时,以更低的计算成本完成推理,并从持续累积的任务历史中更准确地定位关键信息。
从技术路线上看,小米自 MiMo-V2 系列起便持续探索模型能力与计算效率的同步提升。MiMo-V2 系列采用 Hybrid SWA 混合注意力架构,将全注意力与滑动窗口注意力相结合,在维持模型效果的前提下改善训练与推理效率。过去半年,团队将强化学习方向的训练经验应用于 MiMo-V2.6 系列,推动模型能力取得明显进展。
在 V2 系列迭代的同时,面向 MiMo-V3 的新架构研究同步推进。此前公开的 HySparse 是该路线的首个阶段性成果,而此次公布的 HySparse2 在其基础上进一步升级了 KV 共享与稀疏选择机制,使模型在处理长上下文时兼顾效率与精度。官方给出的核心特征包括:更少的 Prefill 计算、更小的 KV Cache,以及更精准的长上下文检索。
对于 AI 行业而言,长程多轮 Agent 场景对上下文长度与推理成本提出了双重挑战。HySparse2 所强调的 KV Cache 压缩与稀疏检索优化,正是当前大模型推理效率竞争中的关键方向之一。小米此次公开架构细节,也为其 MiMo-V3 的后续发布提供了技术铺垫。