Suno上线Speech:念白和配乐一次生成,最长8分钟
AI音乐平台Suno推出名为Suno Speech的新功能,进入公开测试,网页端和移动端都能用。官方的说法是,这是第一个把语音和音乐作为单一连贯音轨一起生成的音频模型。和常见做法不一样的地方在于它不走先合成语音、再贴一段背景音乐的两步流程,而是一次生成完整成品,Suno把它当作自己在这个方向上的差异化。
用法有两种。简易模式是写一段描述,让模型自己发挥,官方举的例子是一位海盗船长在鼓舞船员;高级模式可以上传已经写好的脚本,再单独调AI声音的性别、表达风格,以及每次生成的变化幅度。单次生成的音频最长约8分钟,背景音乐可以一键关掉,只要干净的念白也行。入口在创作页的Speech选项里。
Suno首席产品官Jack Brody在公告里的表述是,音乐始终是Suno的核心,但公司的视野一直延伸到音乐之外的人类表达。这句话解释了这个功能为什么会出现。Suno的主业是音乐生成,把能力延伸到语音领域,既有产品线多元化的考虑,也能把原创音频这套叙事往外扩一圈。
官方自己把Beta版的问题写得很直白。口音会不稳定,比如英式口音可能中途漂移到澳音,再漂回来;语调和情感停顿有时会显得过于戏剧化,导致断句节奏偏慢。这些说明被放在发布公告里,等于提前把预期压下来。Suno表示会按公开测试期间收集的反馈继续改进。
语音合成本身是条拥挤的赛道。DeepMind在这个方向做了十年深度学习语音合成的研究,Adobe有文字转语音工具,ElevenLabs从2023年起已经是这个领域最有辨识度的平台之一。Suno挤进来靠的不是模型指标,而是念白配乐一起出这件事本身:市场上做纯语音的工具很多,能同时把配乐风格也定下来的不多。
值得观察的是使用场景能不能立住。官方给出的设想包括诗歌朗读、冥想音频、鼓舞演讲和睡前故事,这些场景的共同点是对配乐的情绪指向有要求,而不是随便垫一段背景音。如果这条路径跑通,Suno拿到的会是音乐生成之外的一块新地盘;如果用户只是想要一段干净的朗读,那它面对的仍是那些更成熟的文字转语音产品。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
主题:官方