快讯 23:34Anthropic工程师解析Claude写作退化:模型被训练成写给AI而非人类23:31谷歌发布Gemini 3.8 Flash系列TTS模型,支持自然语言定制语音23:25谷歌DeepMind推出Gemini 3.8系列语音模型,支持自然语言定制音色 全部快讯 →
实操专栏 新大陆研究院 约 2 分钟读完 素材来源 IT之家

小米 MiMo-V3 架构升级:HySparse 2 发布,1M 上下文预填充算力降 5 倍

小米 MiMo 大模型负责人罗福莉宣布 MiMo-V3 将采用全新架构,核心组件 HySparse 2 于 9 月 23 日发布。该架构在 1M Token 长度下将预填充计算量降低 5.02 倍、KV 缓存缩小 4.5 倍,并提升长上下文检索评分,针对智能体推理场景优化。

9 月 23 日,小米 MiMo 大模型负责人罗福莉通过社交平台宣布,MiMo-V3 即将切换至一套全新架构,其核心组件 HySparse 2 于同日正式发布。该方案围绕智能体推理场景展开设计,目标是在长上下文条件下同时压低预填充成本、KV 缓存占用与检索误差。

罗福莉指出,智能体推理与常规推理存在本质差异:每一轮交互中,一个简短动作可能触发长文本观察结果,这些内容需要重新预填充,而上下文仍在持续膨胀。由此,预填充成本、KV 缓存大小和检索准确率被同时推上关键路径,成为制约效率的核心变量。

HySparse 2 给出的量化结果包括:在 1M(100 万)Token 长度下,预填充计算量(FLOPs)降低 5.02 倍,KV 缓存缩小 4.5 倍;同时 MRCRv2 与 RULER-v2 评分更高,AgentPPL 和 LongPPL 更低。这意味着模型在长上下文检索质量与困惑度指标上均获得改善。

架构层面,HySparse 2 引入两项关键机制。其一是 KV 桥接(KV Bridging),遵循 YOCO 思路,交叉解码器中的全注意力层利用自解码器的隐藏状态构建 K/V;其二是 KV 重用(KV Reuse),在每个混合块内,稀疏层复用前一层全注意力层的 KV 缓存与选择索引。此外,方案将选择粒度从块级别调整为 Token 级别,并以近期 Token 的强制窗口替代独立的 SWA 分支,使本地与全局 Token 共享同一 KV 缓存。由于所有交叉解码器 KV 缓存均来自自解码器,该设计进一步简化了缓存来源。

小米MiMoHySparse 2大模型架构
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
50
企业落地案例
6
完整版提示词