快讯 23:59阿里预判三年内原生全模态统一生成模型将落地23:46Agent时代,CPU的价值该重估了22:35Meta macOS AI助手Muse曝0-day漏洞:本地应用可窃取账户令牌 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期三 · 09-23 15:15 约 2 分钟读完

阿里千问推出Qwen-Audio-3.1系列,五款语音模型全线降价

摘要

阿里千问发布Qwen-Audio-3.1系列语音大模型,新增TTS-Next与ASR-Next两款模型,形成覆盖理解、生成、交互、创作的完整音频能力栈。全线产品同步降价,TTS降约70%,Realtime降约85%,ASR降幅达95%。

9月23日,阿里千问正式对外发布Qwen-Audio-3.1系列语音大模型。此次更新覆盖语音识别、语音合成与实时语音交互三条核心产品线,并首次推出音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next。官方表示,五款新模型共同构成一套从“理解”到“生成”再到“交互”与“创作”的完整音频能力栈。

在语音识别方向,Qwen-Audio-3.1-ASR着重强化了多语种、方言识别与上下文理解能力,并新增原生转写润色功能,可自动剔除语气词与重复表达、重组语义,使转写文本更顺畅。该模型采用端到端方案,将说话人标签、时间戳与文本联合输出,支持分角色转写,能够保留短插话和重叠语音,为会议、访谈等场景提供结构化记录。官方数据显示,一套模型可支持30种语言和16种中文方言。

价格调整是本次发布的另一重点。Qwen-Audio全线语音模型均下调定价,其中TTS降价约70%,Realtime降幅约85%,ASR降幅达到95%。这一幅度意味着语音识别能力的调用成本被大幅压缩,对依赖大规模语音处理的应用场景将产生直接影响。

从产品布局看,千问此次将语音能力拆分为理解、生成、交互、创作四个层次,并以统一系列命名,显示出其在音频赛道从单点模型向能力栈演进的意图。配合全线降价策略,阿里千问正在降低开发者接入语音大模型的门槛,后续在会议记录、多语言客服、音频内容生产等方向的落地节奏值得关注。

阿里千问Qwen-Audio语音大模型降价
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
50
企业落地案例
6
完整版提示词