资讯›热点›正文

AI音乐平台Suno推出Speech,语音与背景音乐一次生成

山河远阔 2026-10-3 16:15 阅读 2 评论 1热点
当地时间10月1日,AI音乐制作平台Suno宣布推出Speech功能并开放公测。该功能号称业界首个将语音与音乐作为单一连贯音轨共同生成的音频模型,用户只需输入文字并描述音色与风格,即可获得带配乐的朗读音频。

当地时间10月1日,AI音乐制作平台Suno宣布推出名为Speech的新功能,并面向所有用户开放公测。Suno称,这是业界首个能够将语音与音乐作为单一连贯音轨共同生成的音频模型,过去一个月它已与小范围用户完成测试。

AI音乐平台Suno推出Speech,语音与背景音乐一次生成

与传统工作流先做文本转语音再拼接背景音乐不同,Speech采用端到端一体化生成:用户只需输入一段文字、诗歌或灵感,再描述心目中的音色与音乐风格,模型便会把人声与配乐作为一条完整音轨同步产出。功能内置两种模式,简单模式用提示词描述效果,进阶模式可直接粘贴既有脚本,并支持调整声音性别、语速风格与每轮生成的变化幅度,单次生成时长上限约8分钟,背景音乐也可单独关闭只保留人声。

在文本转语音领域,ElevenLabs以及OpenAI、谷歌、微软等巨头长期占据主导,多以按字符计费的API对外提供语音。Suno的差异化在于它不单独出售裸嗓音,而是把语音与配乐一并生成,瞄准短视频、播客、有声书与广告等原本需要拼凑语音工具、曲库与剪辑软件的创作者群体。公司也坦承Beta版仍有瑕疵:英式口音可能中途漂移到澳式,戏剧性停顿有时过于夸张,后续将依用户反馈持续改进。

这次发布正值Suno业务密集迭代期。公司在今年3月与9月先后推出v5.5与v6模型,并与华纳音乐、BMG、Believe等达成授权协议,以化解此前的行业诉讼。语音合成能力的加入,让平台从“写歌”延伸到“读稿”,也带来新的版权与滥用隐忧——合成旁白具备情感表现力,恰恰是诈骗与不实信息所觊觎的能力,Suno尚未说明输出是否带水印、如何处理模仿真人的请求。作为多模态音频的一次产品形态探索,Speech能否在创作便捷与风险可控之间找到平衡,将决定它的普及速度。

读者评论 (1)

想参与讨论?请 登录 后发表评论。

  • 豉
    豉油鸡2026-10-03 16:16

    这功能要是真能用,短视频制作成本能降一大半,但真人配音的饭碗估计得抖抖