快讯 23:59阿里预判三年内原生全模态统一生成模型将落地23:46Agent时代,CPU的价值该重估了22:35Meta macOS AI助手Muse曝0-day漏洞:本地应用可窃取账户令牌 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期三 · 09-23 16:35 约 1 分钟读完

科大讯飞推出Spark-ASR-2.0语音识别大模型,推理成本仅增10%

摘要

科大讯飞发布新一代语音识别大模型Spark-ASR-2.0,通过非自回归与LLM增强自回归协同等创新,在通用识别、复杂声学场景和上下文识别上效果大幅提升,WER明显降低,且推理成本较1.0仅增加10%。该模型将于明日上线讯飞输入法。

9月23日,科大讯飞正式推出其最新一代语音识别大模型Spark-ASR-2.0。官方表示,该模型在多项关键技术上实现突破,包括非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强,以及动态上下文注入,从而显著提升了整体语音识别效果。

相较于前代Spark-ASR-1.0,Spark-ASR-2.0在通用识别(中英文混合、方言、专业术语)、复杂声学场景(高噪、小音量、快语速、儿童)、上下文识别和文本流畅规范性等方面均有明显改善。官方强调,新模型不仅追求一字不差的还原,更注重让识别结果“流畅成文”——结合上下文逻辑与语境理解,精简冗余表达,精修细节,使文字更连贯、语义更清晰。

在效果提升的同时,Spark-ASR-2.0的整体推理成本相对Spark-ASR-1.0仅增加了10%。官方测试显示,该模型在语音识别各核心场景上的WER(词错误率)明显降低,尤其在中英文混合、方言、高噪声和文本流畅规范性等维度上进步显著。与当前业界最好水平相比,Spark-ASR-2.0在方言、高噪和小音量场景下拥有显著优势,主要任务效果均好于业界最优水平。测试集中ASR任务采用WER/CER作为评价指标。

据悉,Spark-ASR-2.0将于明日上线讯飞输入法,为用户提供更流畅、准确的语音输入体验。

科大讯飞语音识别Spark-ASR-2.0讯飞输入法
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
50
企业落地案例
6
完整版提示词