xAI推出Grok语音转写2.0:准确率翻倍,多语言词错率降至6.8%
摘要
xAI发布Grok Voice Transcribe 2.0语音转写模型,官方称真实场景准确率较1.0翻倍且价格不变。该模型在Artificial Analysis榜单32个流式模型中准确率居首,多语言能力提升显著,短短语集合词错误率从20.6%降至6.8%。
xAI于近日推出新一代语音转写模型Grok Voice Transcribe 2.0,距离1.0版本发布尚不满一年。官方表示,新模型在真实场景评测中的准确率达到前代的两倍,而API调用价格保持不变,延续了xAI在语音基础设施上的迭代节奏。
在第三方评测机构Artificial Analysis公布的公开榜单中,Grok Voice Transcribe 2.0在32个流式(streaming)语音识别模型中准确率排名第一。流式识别要求模型在音频输入的同时实时输出文本,对延迟和稳定性要求较高,这一排名意味着该模型在实时转写场景中具备竞争力。
多语言能力是本轮升级幅度最大的方向。xAI披露,在短短语集合测试中,Grok Voice Transcribe 2.0的词错误率(WER)从1.0版本的20.6%下降至6.8%,降幅接近三分之二。短短语通常指对话中的碎片化表达,对上下文依赖强,此前是语音转写模型的薄弱环节。
价格不变叠加准确率翻倍,xAI显然希望以性价比切入语音转写市场。对于依赖实时字幕、会议记录或语音交互的开发者而言,多语言词错率的大幅下降可能降低后处理成本。不过,xAI未披露该模型的具体参数量、训练数据规模及支持的语言清单,实际部署效果仍需开发者自行验证。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗