快讯 23:35英伟达为GTX 700至10系老卡推送582.78安全驱动,修复114个漏洞23:02谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让23:01华为 Pura 70 系列获 HarmonyOS 7.0.0.109SP8 升级,新增文本通话声音修复 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期五 · 10-02 07:04 约 1 分钟读完

微软发布首个实时流式语音转写模型MAI-Transcribe-2-Streaming

摘要

微软推出首个实时流式语音转写模型MAI-Transcribe-2-Streaming,支持60种语言和自动语言检测,词错误率2.5%,延迟低至0.13秒,定价为每小时0.54美元,开发者可通过Microsoft Foundry等渠道接入。

微软于10月1日发布公告,正式推出其首个实时流式语音转写模型MAI-Transcribe-2-Streaming。该模型能够在讲话进行时持续输出文字,覆盖60种语言,并支持自动语言检测,标志着微软在流式语音转写领域迈出重要一步。

在性能方面,MAI-Transcribe-2-Streaming实现了2.5%的词错误率和0.13秒的延迟。模型在接收到音频后约100多毫秒内生成首批部分文本,随后根据更多上下文持续修正,并在语句结束后快速提交稳定结果。微软称,在其实时评估中,文字最快可在语音出现后约320毫秒显示。

费用方面,该模型目前处于优惠阶段,价格为每小时0.54美元(约合3.6元人民币),约合每1000分钟9美元(约合60.5元人民币)。开发者可以通过Microsoft Foundry、MAI Playground、OpenRouter等渠道体验或接入。相比之下,微软此前推出的非流式模型MAI-Transcribe-2在Azure Speech公共预览阶段的价格为每小时0.10美元(约合0.67元人民币)。

流式与非流式模型在应用场景上存在差异:流式适合实时对话和字幕,而非流式则适用于录音文件、会议记录和临床文书等完整转写任务。此次发布的流式模型进一步丰富了微软的语音转写产品线,为开发者提供了更多选择。

微软语音转写AI模型
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
57
企业落地案例
9
完整版提示词