快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 昨天 · 星期五 · 09-11 14:51 约 1 分钟读完

小米开源CocktailASR-1:破解鸡尾酒会难题的工业级语音识别大模型

摘要

小米发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1,采用端到端LLM架构,以参考音频为声纹提示,在多人说话环境中精准提取目标语音,多个测试集达SOTA,并具备拒识干扰和思维链推理能力。

9月11日,小米技术宣布正式发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1。该模型瞄准语音识别领域长期存在的“鸡尾酒会”难题——当多人同时说话时,传统系统识别率会显著下降。

Xiaomi-CocktailASR-1采用端到端LLM架构,通过目标说话人的一段参考音频作为声纹提示,能够在复杂多人对话场景中精准提取并仅转录目标用户的语音。官方称,该模型在多个主流多说话人测试集上均达到SOTA,大幅领先现有方案。

除核心的多说话人分离能力外,该模型还兼顾单人识别场景,性能比肩标准ASR模型。同时,它具备拒识非目标说话人干扰语音的能力,当目标说话人不在场时输出空文本,有效避免误触发。此外,模型支持思维链推理模式,可为识别结果提供可解释的推理过程。

目前,Xiaomi-CocktailASR-1的代码与模型已分别在GitHub和HuggingFace平台开源,供研究者和开发者使用。

小米语音识别大模型开源
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词