谷歌发布Gemini 3.5 Transcribe:支持85种语言与说话人分离
摘要
谷歌推出全新语音转文字模型Gemini 3.5 Transcribe,主打高速、精准与低成本,原生支持说话人分离及毫秒级词时间戳,覆盖85种以上语言,并提供自定义词汇表优化专业术语识别,为开发者提供更高效的ASR解决方案。
谷歌近日发布专为语音转文字场景设计的Gemini 3.5 Transcribe模型,旨在解决传统自动语音识别(ASR)在速度、准确率和成本上的痛点。该模型原生集成说话人分离与词级毫秒时间戳功能,能够直接输出带角色标注和精确时间信息的转录文本,减少了后处理工作量。
在语言支持方面,Gemini 3.5 Transcribe可自动识别并处理超过85种语言,同时支持代码切换,即在同一段音频中混合多种语言时仍能保持转录连贯性。这一特性对于多语种会议、国际采访等场景尤为实用。
针对专业领域的识别难题,模型允许开发者通过custom_vocabulary参数传入最多1000个自定义术语,有效规避专有名词、品牌名或行业术语的拼写错误。此外,模型提供Smart Transcription和Verbatim两种转录模式,前者自动优化标点与格式,后者则保留原始口语细节,满足不同应用需求。
谷歌强调,该模型在保持高准确率的同时,显著降低了转录成本,并提升了处理速度。对于需要大规模处理音频内容的企业开发者而言,Gemini 3.5 Transcribe有望成为替代现有ASR方案的有力选项。目前,模型已通过Google AI Studio或Gemini API向开发者开放,具体定价与配额信息可查阅官方文档。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗