Suno推出Speech功能:端到端生成语音与音乐融合音轨
摘要
10月1日,AI音乐平台Suno发布Speech,业界首个将语音与音乐作为单一连贯音轨端到端生成的音频模型,现面向所有用户公测。用户输入文字并描述音色与音乐风格即可创作带BGM的语音音频。Beta版存在口音不稳定、语调停顿过于戏剧化等问题。
当地时间10月1日,AI音乐制作平台Suno宣布推出名为Speech的新功能,官方称其为业界首个能够将语音与音乐作为单一连贯音轨共同生成的音频模型。该功能已结束与小范围用户的测试,正式面向所有人开放公测。
与传统的“先文本转语音、再拼接背景音乐”工作流不同,Speech采用端到端一体化生成方式。Suno强调,这是首个能单次生成完整融合“语音朗读+原创BGM”的端到端闭源音频模型,无需分步处理即可输出连贯的音频内容。
在Suno平台内,用户只需输入一段灵感、一首诗或一段文字,并描述期望的音色与音乐风格,即可创作带有背景音乐的语音音频。该功能已直接内置于Suno中,降低了语音与音乐融合创作的门槛。
Suno同时披露了当前Beta版的不足:偶发口音不稳定,例如英音可能中途漂移至澳音再漂回;语调与情感停顿有时显得“过于戏剧化”,导致断句节奏过慢。这些问题或将在后续迭代中改善。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗