快讯 23:34Anthropic工程师解析Claude写作退化:模型被训练成写给AI而非人类23:31谷歌发布Gemini 3.8 Flash系列TTS模型,支持自然语言定制语音23:25谷歌DeepMind推出Gemini 3.8系列语音模型,支持自然语言定制音色 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期四 · 09-24 23:25 约 1 分钟读完

谷歌DeepMind推出Gemini 3.8系列语音模型,支持自然语言定制音色

摘要

Google DeepMind发布Gemini 3.8 Flash TTS与Flash-Lite TTS两款文本转语音模型,支持自然语言提示词设计声音、30秒样本复刻音色,并提供逐行表演指导、长时音频生成及双说话人编排,覆盖100多种语言。

Google DeepMind在语音生成领域再度落子。该机构最新推出Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS两款文本转语音模型,进一步扩展其Gemini 3.8系列在多模态方向的能力边界。

从功能维度看,两款模型均支持通过自然语言提示词从零开始设计声音,也可基于30秒音频样本完成音色复刻。这意味着用户无需依赖预设音库,即可按需生成特定风格或特定说话人的语音输出。

在控制粒度上,新模型提供了逐行表演指导能力,允许对语音的情绪、节奏等表现层细节进行精细化调节。同时,模型支持长时音频生成以及双说话人场景编排,可满足对话、旁白等更复杂的语音内容生产需求。

语言覆盖方面,Gemini 3.8 Flash TTS与Flash-Lite TTS支持超过100种语言,延续了该系列在多语种场景下的适用性。两款模型以Flash与Flash-Lite命名,或对应不同的性能与成本定位,但官方暂未披露具体参数与定价信息。

Google DeepMindGemini 3.8文本转语音语音生成
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
50
企业落地案例
6
完整版提示词