微软发布首个实时流式语音转写模型MAI-Transcribe-2-Streaming
摘要
微软推出首个实时流式语音转写模型MAI-Transcribe-2-Streaming,支持60种语言和自动语言检测,词错误率2.5%,延迟低至0.13秒,定价为每小时0.54美元,开发者可通过Microsoft Foundry等渠道接入。
微软于10月1日发布公告,正式推出其首个实时流式语音转写模型MAI-Transcribe-2-Streaming。该模型能够在讲话进行时持续输出文字,覆盖60种语言,并支持自动语言检测,标志着微软在流式语音转写领域迈出重要一步。
在性能方面,MAI-Transcribe-2-Streaming实现了2.5%的词错误率和0.13秒的延迟。模型在接收到音频后约100多毫秒内生成首批部分文本,随后根据更多上下文持续修正,并在语句结束后快速提交稳定结果。微软称,在其实时评估中,文字最快可在语音出现后约320毫秒显示。
费用方面,该模型目前处于优惠阶段,价格为每小时0.54美元(约合3.6元人民币),约合每1000分钟9美元(约合60.5元人民币)。开发者可以通过Microsoft Foundry、MAI Playground、OpenRouter等渠道体验或接入。相比之下,微软此前推出的非流式模型MAI-Transcribe-2在Azure Speech公共预览阶段的价格为每小时0.10美元(约合0.67元人民币)。
流式与非流式模型在应用场景上存在差异:流式适合实时对话和字幕,而非流式则适用于录音文件、会议记录和临床文书等完整转写任务。此次发布的流式模型进一步丰富了微软的语音转写产品线,为开发者提供了更多选择。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗