腾讯混元端侧翻译模型压缩至440MB,落地B站直播弹幕实时翻译
摘要
腾讯混元将端侧翻译模型Hy-MT2-1.8B量化压缩至440MB,翻译质量几乎无损,在FLORES-200上优于商业API。该模型已完成x86适配,并落地哔哩哔哩直播弹幕翻译,单条耗时500-800ms。
腾讯混元团队近日披露,其端侧翻译模型Hy-MT2-1.8B通过2-bit与1.25-bit量化方案,将模型体积分别压缩至574MB和440MB,在保持翻译质量几乎无损的前提下,实现了显著的体积缩减。这一进展为端侧部署大规模翻译模型提供了新的技术路径。
在基准测试中,压缩后的模型在FLORES-200数据集上的表现优于Microsoft Translator等商业API,表明其在多语言翻译任务中具备竞争力。量化技术通常以牺牲精度换取效率,但该模型通过算法优化,在极低比特率下仍维持了高翻译质量,显示出腾讯混元在模型压缩领域的积累。
该模型已联合英特尔完成x86架构适配,这意味着它可以在主流服务器和PC处理器上高效运行,为更广泛的端侧应用场景铺平了道路。目前,该模型已在哔哩哔哩直播弹幕实时翻译功能中落地,单条弹幕的翻译耗时仅为500至800毫秒,能够满足直播场景下对低延迟的严苛要求。
这一落地案例表明,端侧翻译模型在资源受限环境下仍能提供接近实时的服务,对提升直播、会议等场景的跨语言交互体验具有实际意义。腾讯混元此次将模型体积压缩至数百MB级别,也为其他端侧AI模型的部署提供了参考范式。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗