ElevenLabs发布v4语音模型,10秒克隆声音支持90种语言
AI语音公司ElevenLabs于9月28日发布v4与v4 Turbo语音模型,支持超过90种语言,仅需10秒音频即可完成声音克隆,实时版延迟低至约100毫秒,并在Artificial Analysis语音竞技场登顶。公司年化营收运行率已突破6亿美元。
AI语音合成赛道迎来一次重要升级。总部位于伦敦的ElevenLabs于9月28日发布新一代语音模型v4与v4 Turbo,在表达力、克隆速度与多语言覆盖上同步跃进,目标直指企业级语音代理与内容本地化市场。

新模型最引人注目的能力是快与准。v4 Turbo面向双向流式实时对话,能够在底层大语言模型开始生成文本的同时就输出音频,首字到语音约150毫秒,推理延迟中位数约100毫秒,让自动电话客服等场景的停顿感大幅降低。克隆方面,即时语音克隆现在只需10秒音频即可捕捉目标声线,并保持跨长文本的声纹一致性。

语言覆盖从上一版的70种提升到超过90种,日语、巴西葡萄牙语、普通话与粤语的质量提升最为明显。ElevenLabs还强化了行内情绪标签,创作者可叠加多个指令来控制语气与节奏。在Artificial Analysis的语音竞技场盲测中,v4以约1321的Elo评分登顶。
商业上,ElevenLabs正处在高速扩张期:年化营收运行率已在9个月内从3.3亿美元增长到突破6亿美元,企业客户贡献超过55%的收入。公司今年初由红杉资本领投完成5亿美元B轮、估值110亿美元,市场已开始流传下一轮估值可能冲上220亿美元、并谋划未来几年IPO的消息。面对Cartesia、Deepgram以及谷歌、OpenAI等对手的围追,语音正成为智能体落地最前线的战场。
读者评论 (1)
想参与讨论?请 登录 后发表评论。
10秒就能克隆人声,听着挺酷但心里总有点发凉,这声音要是被乱用了可谁担责