快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期三 · 09-02 08:23 约 2 分钟读完

Meta发布实时音频感知模型Muse Voice Transcribe,支持20余人分轨转写

摘要

Meta推出首个实时音频感知模型Muse Voice Transcribe,可通过API调用,定价每千分钟3美元。模型整合流式语音识别、说话人分离与端点检测,支持70余种语言,可在20余人对话中分离发言者,适用于实时听写、会议记录等场景。

Meta公司于9月1日推出其首个实时音频感知模型Muse Voice Transcribe,该模型现已通过Meta Model API向开发者开放调用。定价方面,每1000分钟音频收费3美元,折合每小时约0.18美元。这一价格定位使其在同类实时转写服务中具备一定竞争力。

Muse Voice Transcribe的核心特性在于将流式自动语音识别、说话人分离和端点检测整合在同一流程中。与传统方案需等待完整录音结束后再处理不同,该模型采用流式架构,用户说话时系统即同步输出文字,以片段形式持续生成结果,大幅降低延迟,适配实时听写、会议记录和通话字幕等场景。

在技术能力上,该模型可在包含20余名说话者的录音中实现分轨识别,并能检测说话结束与否,自动判定输入边界。训练数据覆盖70余种语言,其中25种语言在发布时已完成验证。模型支持超过1小时的音频处理,并允许句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置参数,优化特定术语或场景的识别效果。

为平衡实时响应与识别准确度,Meta引入了自适应延迟机制。系统并非对所有词语采用统一的处理速度与精度取舍,而是针对每个词动态判断是否需要额外计算资源,从而在保证低延迟的同时维持较高的识别质量。

该模型的发布标志着Meta在实时音频理解领域迈出关键一步。对于依赖实时转写能力的开发者而言,Muse Voice Transcribe提供了新的技术选项,其多说话人分离和长音频支持能力,有望在会议智能化、无障碍沟通等方向产生实际应用价值。

Meta实时音频感知语音识别说话人分离
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词