Meta发布实时音频感知模型Muse Voice Transcribe,支持20余人分轨转写
Meta推出首个实时音频感知模型Muse Voice Transcribe,可通过API调用,定价每千分钟3美元。模型整合流式语音识别、说话人分离与端点检测,支持70余种语言,可在20余人对话中分离发言者,适用于实时听写、会议记录等场景。
Meta公司于9月1日推出其首个实时音频感知模型Muse Voice Transcribe,该模型现已通过Meta Model API向开发者开放调用。定价方面,每1000分钟音频收费3美元,折合每小时约0.18美元。这一价格定位使其在同类实时转写服务中具备一定竞争力。
Muse Voice Transcribe的核心特性在于将流式自动语音识别、说话人分离和端点检测整合在同一流程中。与传统方案需等待完整录音结束后再处理不同,该模型采用流式架构,用户说话时系统即同步输出文字,以片段形式持续生成结果,大幅降低延迟,适配实时听写、会议记录和通话字幕等场景。
在技术能力上,该模型可在包含20余名说话者的录音中实现分轨识别,并能检测说话结束与否,自动判定输入边界。训练数据覆盖70余种语言,其中25种语言在发布时已完成验证。模型支持超过1小时的音频处理,并允许句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置参数,优化特定术语或场景的识别效果。
为平衡实时响应与识别准确度,Meta引入了自适应延迟机制。系统并非对所有词语采用统一的处理速度与精度取舍,而是针对每个词动态判断是否需要额外计算资源,从而在保证低延迟的同时维持较高的识别质量。
该模型的发布标志着Meta在实时音频理解领域迈出关键一步。对于依赖实时转写能力的开发者而言,Muse Voice Transcribe提供了新的技术选项,其多说话人分离和长音频支持能力,有望在会议智能化、无障碍沟通等方向产生实际应用价值。