谷歌DeepMind推出Gemini 3.8系列语音模型,支持自然语言定制音色
摘要
Google DeepMind发布Gemini 3.8 Flash TTS与Flash-Lite TTS两款文本转语音模型,支持自然语言提示词设计声音、30秒样本复刻音色,并提供逐行表演指导、长时音频生成及双说话人编排,覆盖100多种语言。
Google DeepMind在语音生成领域再度落子。该机构最新推出Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS两款文本转语音模型,进一步扩展其Gemini 3.8系列在多模态方向的能力边界。
从功能维度看,两款模型均支持通过自然语言提示词从零开始设计声音,也可基于30秒音频样本完成音色复刻。这意味着用户无需依赖预设音库,即可按需生成特定风格或特定说话人的语音输出。
在控制粒度上,新模型提供了逐行表演指导能力,允许对语音的情绪、节奏等表现层细节进行精细化调节。同时,模型支持长时音频生成以及双说话人场景编排,可满足对话、旁白等更复杂的语音内容生产需求。
语言覆盖方面,Gemini 3.8 Flash TTS与Flash-Lite TTS支持超过100种语言,延续了该系列在多语种场景下的适用性。两款模型以Flash与Flash-Lite命名,或对应不同的性能与成本定位,但官方暂未披露具体参数与定价信息。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗