科大讯飞推出Spark-ASR-2.0语音识别大模型,推理成本仅增10%
摘要
科大讯飞发布新一代语音识别大模型Spark-ASR-2.0,通过非自回归与LLM增强自回归协同等创新,在通用识别、复杂声学场景和上下文识别上效果大幅提升,WER明显降低,且推理成本较1.0仅增加10%。该模型将于明日上线讯飞输入法。
9月23日,科大讯飞正式推出其最新一代语音识别大模型Spark-ASR-2.0。官方表示,该模型在多项关键技术上实现突破,包括非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强,以及动态上下文注入,从而显著提升了整体语音识别效果。
相较于前代Spark-ASR-1.0,Spark-ASR-2.0在通用识别(中英文混合、方言、专业术语)、复杂声学场景(高噪、小音量、快语速、儿童)、上下文识别和文本流畅规范性等方面均有明显改善。官方强调,新模型不仅追求一字不差的还原,更注重让识别结果“流畅成文”——结合上下文逻辑与语境理解,精简冗余表达,精修细节,使文字更连贯、语义更清晰。
在效果提升的同时,Spark-ASR-2.0的整体推理成本相对Spark-ASR-1.0仅增加了10%。官方测试显示,该模型在语音识别各核心场景上的WER(词错误率)明显降低,尤其在中英文混合、方言、高噪声和文本流畅规范性等维度上进步显著。与当前业界最好水平相比,Spark-ASR-2.0在方言、高噪和小音量场景下拥有显著优势,主要任务效果均好于业界最优水平。测试集中ASR任务采用WER/CER作为评价指标。
据悉,Spark-ASR-2.0将于明日上线讯飞输入法,为用户提供更流畅、准确的语音输入体验。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗