快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期一 · 08-31 16:04 约 1 分钟读完

腾讯混元端侧翻译模型压缩至440MB,落地B站直播弹幕实时翻译

摘要

腾讯混元将端侧翻译模型Hy-MT2-1.8B量化压缩至440MB,翻译质量几乎无损,在FLORES-200上优于商业API。该模型已完成x86适配,并落地哔哩哔哩直播弹幕翻译,单条耗时500-800ms。

腾讯混元团队近日披露,其端侧翻译模型Hy-MT2-1.8B通过2-bit与1.25-bit量化方案,将模型体积分别压缩至574MB和440MB,在保持翻译质量几乎无损的前提下,实现了显著的体积缩减。这一进展为端侧部署大规模翻译模型提供了新的技术路径。

在基准测试中,压缩后的模型在FLORES-200数据集上的表现优于Microsoft Translator等商业API,表明其在多语言翻译任务中具备竞争力。量化技术通常以牺牲精度换取效率,但该模型通过算法优化,在极低比特率下仍维持了高翻译质量,显示出腾讯混元在模型压缩领域的积累。

该模型已联合英特尔完成x86架构适配,这意味着它可以在主流服务器和PC处理器上高效运行,为更广泛的端侧应用场景铺平了道路。目前,该模型已在哔哩哔哩直播弹幕实时翻译功能中落地,单条弹幕的翻译耗时仅为500至800毫秒,能够满足直播场景下对低延迟的严苛要求。

这一落地案例表明,端侧翻译模型在资源受限环境下仍能提供接近实时的服务,对提升直播、会议等场景的跨语言交互体验具有实际意义。腾讯混元此次将模型体积压缩至数百MB级别,也为其他端侧AI模型的部署提供了参考范式。

腾讯混元端侧翻译模型压缩量化
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词