讯飞星火语音基座大模型预览版上线,全国产算力训练
摘要
科大讯飞发布Spark-Audio-1.0-Preview语音基座大模型,基于纯国产算力集群训练。该模型采用0.65B音频编码器与30B-A3B MoE大语言模型,使用1300万小时音频数据,可直接理解语音中的语义、情绪和场景,支持转写、翻译、方言识别等任务。
科大讯飞于9月16日推出Spark-Audio-1.0-Preview,一款基于全国产化算力集群训练的语音基座大模型。该模型旨在突破传统级联方案的技术瓶颈,让机器直接从语音信号中获取信息。
此前,大模型处理音频普遍采用“先转写、后理解”的级联路径。这种方式存在两方面局限:一是信息丢失,文字转写仅保留语义内容,语气、情绪及背景环境音等关键线索被过滤,导致模型对场景判断不完整;二是链路割裂,语音转写、声纹识别、语音翻译等能力被拆分为独立模块串联运行,模块间存在断点,容易累积错误并带来延迟与卡顿。
Spark-Audio-1.0-Preview采用0.65B参数量的Dense结构音频编码器,搭配30B-A3B的MoE结构大语言模型。训练数据涵盖1300万小时音频及大量文本,全部基于纯国产算力集群完成。该模型在同一框架内支持文本与语音双模态输入,可执行语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂音频问答等任务。
从“听清”到“听懂”,语音基座大模型的推出意味着音频处理不再依赖多模块拼接,而是由单一模型直接完成对声音语义、情绪和场景的综合理解。这一路径若成熟,有望降低级联方案中的错误累积与延迟问题,为语音交互场景提供更完整的感知能力。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗