快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期一 · 08-31 07:01 约 1 分钟读完

谷歌发布Gemini 3.5 Transcribe,实时语音转写精度再提升

摘要

谷歌推出Gemini 3.5 Transcribe,号称最精准的语音转文本模型,支持实时流式与预录音频处理,可通过Live API和Interactions API调用,为开发者提供更高效的语音交互解决方案。

谷歌近日宣布推出Gemini 3.5 Transcribe,这是其最新的语音转文本模型,旨在提供更精准的实时语音转写能力。该模型支持实时流式音频和预录音频处理,能够满足不同场景下的语音识别需求。

Gemini 3.5 Transcribe可通过Live API和Interactions API进行调用,为开发者提供了灵活的集成方式。Live API适用于实时交互场景,如语音助手和实时字幕;Interactions API则更适合处理预录音频,如会议记录和媒体转写。

据谷歌介绍,该模型在语音识别精度上实现了显著提升,尤其在嘈杂环境和多说话人场景下表现更为出色。这得益于其先进的声学建模和语言理解技术,能够更准确地捕捉语音细节并减少误识别。

此次发布标志着谷歌在语音AI领域的持续投入,旨在为企业和开发者提供更可靠的工具。随着语音交互需求的增长,Gemini 3.5 Transcribe有望在客服、医疗、教育等行业发挥重要作用,推动语音技术的进一步落地。

谷歌语音识别Gemini 3.5 Transcribe实时转写
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词