腾讯开源Hy4 preview轻量版:权重压缩至214GB,异构设备可联合推理
腾讯混元团队发布Hy4 preview轻量版,将770B参数MoE模型权重从近1.5TB压缩至214GB,采用Sherry稀疏三值量化与MIX-STQ1_0混合精度策略,长文理解与多轮检索性能基本持平BF16版本,并支持异构设备联合推理。
腾讯混元团队今日正式开源Hy4 preview轻量版,将新一代MoE大语言模型的权重体积从接近1.5TB压缩至约214GB。该模型于8月28日发布,总参数量达7700亿,激活参数为490亿,支持100万Token上下文长度。此次体积缩减通过两项核心技术实现,为大规模模型在资源受限场景下的部署提供了新路径。
压缩方案的核心之一是Sherry稀疏三值量化算法,它将路由专家层的权重平均压缩至1.25比特,大幅降低存储需求。另一项MIX-STQ1_0混合精度策略则依据校准数据逐层决定量化位宽,敏感层保留2.06比特精度,非敏感层采用更激进的1.31比特设置。这种分层处理方式在保证关键信息完整性的同时,实现了整体压缩率的最优化。
性能测试显示,轻量版在主流任务上保持稳定表现:长文理解能力几乎与原始BF16版本持平,多轮长上下文检索也基本处于同一水平。数学能力仅有小幅回落,MCP Atlas得分从83.7微降至83.2,SWE-Bench multi从82.9降至81.3。这些数据表明,量化带来的精度损失被控制在可接受范围内,尤其适合对存储和计算资源敏感的部署环境。
在异构设备联合推理方面,腾讯混元与prima.cpp合作验证了新方案,成功在一台配备单张RTX 4090显卡的机器上运行部分模型,并通过跨设备协作完成推理任务。这一进展打破了单卡显存限制,为未来在边缘设备上部署超大规模模型提供了实践基础,也体现了开源生态在推动AI基础设施创新中的协同效应。