快讯 23:34Anthropic工程师解析Claude写作退化:模型被训练成写给AI而非人类23:31谷歌发布Gemini 3.8 Flash系列TTS模型,支持自然语言定制语音23:25谷歌DeepMind推出Gemini 3.8系列语音模型,支持自然语言定制音色 全部快讯 →
研究院报告 新大陆研究院 约 2 分钟读完 素材来源 IT之家

谷歌发布Gemini 3.8 Flash系列TTS模型,支持自然语言定制语音

谷歌推出Gemini 3.8 Flash TTS和Flash-Lite TTS两款文本转语音模型,支持通过自然语言提示创建定制语音,覆盖100多种语言,语音库扩展至2000多种,仅需30秒音频样本即可复制声音。

谷歌今日为Gemini家族增添两名新成员——Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS,两款文本转语音模型均以动态语音生成为核心,试图将传统TTS的静态预设模式转变为可实时调整的创作工具。这一更新同时面向创作者、开发者与企业用户,并已应用于Gemini Notebook和Google Vids等产品中。

两款模型在定位上形成明确分工。Gemini 3.8 Flash TTS侧重深度创意与角色塑造,允许用户通过自然语言提示从零构建全新语音,适用于游戏、沉浸式有声读物、播客及互动媒体等场景,并支持对表演提示、节奏和方言转换进行精细控制。Gemini 3.8 Flash-Lite TTS则瞄准大容量、高性价比的规模化需求,针对批量配音、音频内容生产和语音代理优化,同样提供音调、节奏与表现力层面的微调能力。

在功能层面,两款模型引入了生成式语音设计,用户以自然语言即可在100多种语言和方言中自定义角色、口音与语音特征。语音库从原先的30种原始语音扩展至2000多种现成语音,涵盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。语音复制功能仅需30秒音频样本即可重现一致的声音特征,并内置同意验证机制。

从行业角度看,谷歌此次将TTS能力从固定音色库推向自然语言驱动的定制化生成,意味着语音合成正进一步向创作工具演进。对开发者而言,更低的定制门槛与更丰富的语言覆盖,可能加速有声内容、游戏NPC对话及语音代理等应用的迭代节奏。

谷歌Gemini文本转语音AI语音
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
50
企业落地案例
6
完整版提示词