谷歌发布Gemini 3.5 Transcribe,实时语音转写精度再提升
摘要
谷歌推出Gemini 3.5 Transcribe,号称最精准的语音转文本模型,支持实时流式与预录音频处理,可通过Live API和Interactions API调用,为开发者提供更高效的语音交互解决方案。
谷歌近日宣布推出Gemini 3.5 Transcribe,这是其最新的语音转文本模型,旨在提供更精准的实时语音转写能力。该模型支持实时流式音频和预录音频处理,能够满足不同场景下的语音识别需求。
Gemini 3.5 Transcribe可通过Live API和Interactions API进行调用,为开发者提供了灵活的集成方式。Live API适用于实时交互场景,如语音助手和实时字幕;Interactions API则更适合处理预录音频,如会议记录和媒体转写。
据谷歌介绍,该模型在语音识别精度上实现了显著提升,尤其在嘈杂环境和多说话人场景下表现更为出色。这得益于其先进的声学建模和语言理解技术,能够更准确地捕捉语音细节并减少误识别。
此次发布标志着谷歌在语音AI领域的持续投入,旨在为企业和开发者提供更可靠的工具。随着语音交互需求的增长,Gemini 3.5 Transcribe有望在客服、医疗、教育等行业发挥重要作用,推动语音技术的进一步落地。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗