快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期一 · 08-31 21:34 约 1 分钟读完

谷歌发布Gemini 3.5 Transcribe:支持85种语言与说话人分离

摘要

谷歌推出全新语音转文字模型Gemini 3.5 Transcribe,主打高速、精准与低成本,原生支持说话人分离及毫秒级词时间戳,覆盖85种以上语言,并提供自定义词汇表优化专业术语识别,为开发者提供更高效的ASR解决方案。

谷歌近日发布专为语音转文字场景设计的Gemini 3.5 Transcribe模型,旨在解决传统自动语音识别(ASR)在速度、准确率和成本上的痛点。该模型原生集成说话人分离与词级毫秒时间戳功能,能够直接输出带角色标注和精确时间信息的转录文本,减少了后处理工作量。

在语言支持方面,Gemini 3.5 Transcribe可自动识别并处理超过85种语言,同时支持代码切换,即在同一段音频中混合多种语言时仍能保持转录连贯性。这一特性对于多语种会议、国际采访等场景尤为实用。

针对专业领域的识别难题,模型允许开发者通过custom_vocabulary参数传入最多1000个自定义术语,有效规避专有名词、品牌名或行业术语的拼写错误。此外,模型提供Smart Transcription和Verbatim两种转录模式,前者自动优化标点与格式,后者则保留原始口语细节,满足不同应用需求。

谷歌强调,该模型在保持高准确率的同时,显著降低了转录成本,并提升了处理速度。对于需要大规模处理音频内容的企业开发者而言,Gemini 3.5 Transcribe有望成为替代现有ASR方案的有力选项。目前,模型已通过Google AI Studio或Gemini API向开发者开放,具体定价与配额信息可查阅官方文档。

谷歌Gemini 3.5语音识别ASR
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词