小米开源CocktailASR-1:破解鸡尾酒会难题的工业级语音识别大模型
摘要
小米发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1,采用端到端LLM架构,以参考音频为声纹提示,在多人说话环境中精准提取目标语音,多个测试集达SOTA,并具备拒识干扰和思维链推理能力。
9月11日,小米技术宣布正式发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1。该模型瞄准语音识别领域长期存在的“鸡尾酒会”难题——当多人同时说话时,传统系统识别率会显著下降。
Xiaomi-CocktailASR-1采用端到端LLM架构,通过目标说话人的一段参考音频作为声纹提示,能够在复杂多人对话场景中精准提取并仅转录目标用户的语音。官方称,该模型在多个主流多说话人测试集上均达到SOTA,大幅领先现有方案。
除核心的多说话人分离能力外,该模型还兼顾单人识别场景,性能比肩标准ASR模型。同时,它具备拒识非目标说话人干扰语音的能力,当目标说话人不在场时输出空文本,有效避免误触发。此外,模型支持思维链推理模式,可为识别结果提供可解释的推理过程。
目前,Xiaomi-CocktailASR-1的代码与模型已分别在GitHub和HuggingFace平台开源,供研究者和开发者使用。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗