阿里千问推出Qwen3.8-LiveTranslate同传大模型,字均延迟降至2.3秒
摘要
阿里千问9月19日发布同声传译大模型Qwen3.8-LiveTranslate,采用Interleave架构与Hybrid MoE双模块设计,字均延迟从2.8秒降至2.3秒。模型支持60种语言,新增说话人分离、原文译文同帧同出、长上下文消歧三项能力,在多说话人长音频评测中四项指标均优于行业主流系统。
阿里千问于9月19日正式发布同声传译大模型Qwen3.8-LiveTranslate。该模型以Interleave架构对实时同传流程进行重构,在准确度、流畅度和简洁度三个维度上实现全面提升,字均延迟(LAAL)由此前的2.8秒压缩至2.3秒。
在语言覆盖方面,Qwen3.8-LiveTranslate支持60种语言。在此基础上,模型新增三项面向真实场景的能力:实时说话人分离,确保每句话归属清晰且音色复刻更稳定;原文译文同帧同出,实现双语同屏显示;长上下文消歧,通过联系前文提升人名和术语翻译的精准度。
技术架构上,该模型采用基于Hybrid MoE的Thinker–Talker双模块设计,以Interleave方式衔接流式理解、文本输出与语音生成。其中,Thinker模块将视频、音频、原文与译文编排进同一条因果序列,按时序交替排列并端到端产出,使理解与翻译在单一序列内完成;Talker模块则结合译文和源音频,将译文合成为保留原说话人音色的语音。
在覆盖14个语向的多说话人长音频评测集Omnilingua-MSpeaker上,Qwen3.8-LiveTranslate在翻译忠实度、流畅度、简洁度以及说话人分离错误率(DER)四个维度上,均优于当前行业主流的实时同传系统。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗