谷歌今日为Gemini家族增添两名新成员——Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS,两款文本转语音模型均以动态语音生成为核心,试图将传统TTS的静态预设模式转变为可实时调整的创作工具。这一更新同时面向创作者、开发者与企业用户,并已应用于Gemini Notebook和Google Vids等产品中。
两款模型在定位上形成明确分工。Gemini 3.8 Flash TTS侧重深度创意与角色塑造,允许用户通过自然语言提示从零构建全新语音,适用于游戏、沉浸式有声读物、播客及互动媒体等场景,并支持对表演提示、节奏和方言转换进行精细控制。Gemini 3.8 Flash-Lite TTS则瞄准大容量、高性价比的规模化需求,针对批量配音、音频内容生产和语音代理优化,同样提供音调、节奏与表现力层面的微调能力。
在功能层面,两款模型引入了生成式语音设计,用户以自然语言即可在100多种语言和方言中自定义角色、口音与语音特征。语音库从原先的30种原始语音扩展至2000多种现成语音,涵盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。语音复制功能仅需30秒音频样本即可重现一致的声音特征,并内置同意验证机制。
从行业角度看,谷歌此次将TTS能力从固定音色库推向自然语言驱动的定制化生成,意味着语音合成正进一步向创作工具演进。对开发者而言,更低的定制门槛与更丰富的语言覆盖,可能加速有声内容、游戏NPC对话及语音代理等应用的迭代节奏。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家 ↗