快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期五 · 09-04 08:11 约 2 分钟读完

微软发布MAI-Transcribe-2语音转写模型,60语种错误率降至5.2%

摘要

微软推出新一代AI语音转文字模型MAI-Transcribe-2,在FLEURS测试集上实现5.2%的平均词错误率,覆盖60种语言。该模型限时定价0.10美元/小时,优惠持续至2026年底,性能显著优于Gemini、GPT-Transcribe等竞品。

微软于9月3日通过官方博客正式发布MAI-Transcribe-2,定位为旗下迄今最快、最精准且成本最优的语音转文字AI模型。该产品面向开发者与企业级应用,主打高精度转录与多语言支持,进一步加码其在AI音频处理赛道的布局。

在性能基准测试中,MAI-Transcribe-2于FLEURS数据集上展现了领先实力。无论是强制指定语言还是自动推断语言模式,其平均词错误率均稳定在5.2%,而同期对比的Gemini 3.1 Pro对应成绩为5.3%和5.8%,GPT-Transcribe为10.4%和10.6%,Whisper v3-Large则高达22.8%和23.5%。这一数据意味着该模型在跨语种识别准确性上实现了显著突破。

速度方面,根据Artificial Analysis的独立评测,MAI-Transcribe-2的推理效率较GPT-Transcribe提升约10倍,对比Scribe v2快7倍,并比Gemini 3.5 Transcribe快5倍。这一性能优势将直接降低大规模音频转写任务的时间成本,对实时会议记录、客服质检等场景尤为关键。

功能层面,该模型新增说话人分离能力,可在同一段录音中精准区分不同发言者并将文字归属至对应人物;同时提供逐词时间戳,为每个词标注精确时间位置。这些特性增强了后续编辑、检索与分析的便利性,尤其适用于访谈、庭审及媒体制作等需要精细切分的场景。

定价策略上,MAI-Transcribe-2上市初期推出限时优惠,收费仅为0.10美元/小时(约合人民币0.67元),该价格将持续至2026年年底。微软此举意在降低企业试用门槛,以高性价比策略快速抢占市场份额,并挤压现有转录服务商的生存空间。

微软语音识别AI模型MAI-Transcribe-2
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词