ElevenLabs 发布 v4 语音模型:90 余种语言支持,10 秒音频完成声音克隆
摘要
ElevenLabs 正式推出 v4 与 v4 Turbo 语音模型,支持 90 余种语言,较上代增加 20 种。新架构下用户仅需 10 秒音频即可克隆声音,情绪标签支持叠加,并可在大语言模型输出时同步生成语音,适配低延迟语音智能体场景。
当地时间周一,ElevenLabs 正式发布两款新一代语音模型——v4 与 v4 Turbo。这是继去年 v3 之后的又一次重要迭代,该公司曾于今年早些时候在华沙举办的活动上对新一代模型进行过预热。
据官方介绍,v4 系列采用全新架构,在语音控制精度与声音克隆速度上均有明显提升。用户只需提供 10 秒音频素材,即可完成声音克隆。在朗读大段文本时,新模型能够更好地保持说话人的音色一致性,并可结合前后文本语境动态调整语气。
情绪表达方面,ElevenLabs 在 v3 中首次引入内联标签机制来设定语音情绪,v4 则进一步扩展了标签功能,允许用户叠加多个标签,模型将按照标签的先后顺序依次执行。语言支持从旧版的 70 种提升至 90 余种,其中日语、巴西葡萄牙语、普通话和粤语的合成质量改善最为突出。
在应用层面,ElevenLabs 指出新模型尤其适合语音智能体场景。更低的响应延迟有助于实现更流畅的对话体验;此外,当后端大语言模型刚开始输出回答时,v4 即可同步生成语音音频。该公司还透露,过去一年企业语音通话业务扩张迅速,目前超过 55% 的业务收入来自大型企业客户。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗