快讯 23:57Meta One订阅服务上线,最高月费499美元瞄准AI重度用户23:41Gergely Orosz 探访 OpenAI 总部:Codex 已渗透几乎所有日常工作23:33华为郭平座谈新员工:供应链对标苹果,计算领域瞄准英伟达 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期三 · 09-16 16:44 约 1 分钟读完

讯飞星火语音基座大模型预览版上线,全国产算力训练

摘要

科大讯飞发布Spark-Audio-1.0-Preview语音基座大模型,基于纯国产算力集群训练。该模型采用0.65B音频编码器与30B-A3B MoE大语言模型,使用1300万小时音频数据,可直接理解语音中的语义、情绪和场景,支持转写、翻译、方言识别等任务。

科大讯飞于9月16日推出Spark-Audio-1.0-Preview,一款基于全国产化算力集群训练的语音基座大模型。该模型旨在突破传统级联方案的技术瓶颈,让机器直接从语音信号中获取信息。

此前,大模型处理音频普遍采用“先转写、后理解”的级联路径。这种方式存在两方面局限:一是信息丢失,文字转写仅保留语义内容,语气、情绪及背景环境音等关键线索被过滤,导致模型对场景判断不完整;二是链路割裂,语音转写、声纹识别、语音翻译等能力被拆分为独立模块串联运行,模块间存在断点,容易累积错误并带来延迟与卡顿。

Spark-Audio-1.0-Preview采用0.65B参数量的Dense结构音频编码器,搭配30B-A3B的MoE结构大语言模型。训练数据涵盖1300万小时音频及大量文本,全部基于纯国产算力集群完成。该模型在同一框架内支持文本与语音双模态输入,可执行语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂音频问答等任务。

从“听清”到“听懂”,语音基座大模型的推出意味着音频处理不再依赖多模块拼接,而是由单一模型直接完成对声音语义、情绪和场景的综合理解。这一路径若成熟,有望降低级联方案中的错误累积与延迟问题,为语音交互场景提供更完整的感知能力。

科大讯飞语音大模型国产算力
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
41
企业落地案例
4
完整版提示词