快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期一 · 08-31 01:01 约 1 分钟读完

Google DeepMind发布Gemini 3.5 Transcribe,主打高精度实时语音转写

摘要

Google DeepMind推出Gemini 3.5 Transcribe语音转文本模型,支持流式与非流式API。Artificial Analysis评测显示,其流式与非流式平均词错率分别为4.0%和2.6%,支持超85种语言、自定义词汇及三人说话人识别,为实时语音交互提供更精准的底层能力。

Google DeepMind今日正式发布Gemini 3.5 Transcribe,一款面向实时语音交互场景的专用语音转文本模型。该模型同时提供流式与非流式两种API接入方式,旨在覆盖从即时对话到离线批处理的多类应用需求。

据独立评测机构Artificial Analysis的最新数据,Gemini 3.5 Transcribe在流式模式下的平均词错率为4.0%,非流式模式下则为2.6%。这一成绩表明,模型在保持低延迟响应的同时,并未显著牺牲转写精度,为开发者提供了兼顾实时性与准确性的技术选项。

在功能覆盖面上,该模型支持超过85种语言的语音识别,并内置自定义词汇表功能,允许用户针对特定领域术语进行优化。此外,模型还具备最多三人的说话人识别能力,可区分不同发言者,适用于会议纪要、客服对话等多人交互场景。

此次发布延续了DeepMind在语音技术上的迭代节奏。此前,Gemini系列模型已在多模态理解上积累优势,而Transcribe子模型的独立推出,则显示出其将底层能力拆解为专项服务的策略,以更灵活地适配不同开发者的调用需求。

对于AI应用开发者而言,更低词错率与多语言支持意味着更可靠的交互基础,而流式API的优化则可能推动实时翻译、语音助手等场景的体验升级。目前,该模型已通过Google AI Studio及Vertex AI平台开放使用。

Google DeepMind语音识别Gemini实时交互
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词