仅需30秒完美复刻任何人的声音 - 最强AI音频11Labs

原创数字生命卡兹克数字生命卡兹克 2023-10-26 18:53 天津

原文地址: https://mp.weixin.qq.com/s/BKP_s4dupr3Qaq-1INB-tQ

互动数据

阅读：28191
点赞：274
转发：1919
喜欢：61
留言：54

我的用词一直都挺克制的，基本不会用到“最强”这个字眼。

但是这一次的这个AI应用，是我认为在TTS（文字转音频）这个领域，当之无愧的“最强”。

ElevenLabs，简称11Labs。

仅需30秒到5分钟左右的极少的数据集，就可以直接克隆任何一个人的声音，完美复刻他的说话方式、他的音色，甚至连他的情绪都复刻过来。

最牛逼的是，你不需要再额外做任何操作，就可以直接用同样的声音，说出29国的语言。那个流畅度，那个口语表达。。。我在AI面前宛如一个废物。

我简单用11Labs+奇妙元做了一个特朗普的demo，大家可以感受一下。

11Labs网址在此（上不去就开魔法）：

https://elevenlabs.io/

尽管很多的大厂的语音TTS能力已经很强大了，比如微软的TTS、比如国庆期间刷爆全网的GPT的语音TTS，但是这些大厂有一个问题，就是公司体量实在太大了，在商业化上的舆论影响和被监管风险也极大，所以这种超低成本的语音克隆TTS，他们至今也没有向大众公开，毕竟很容易受到全社会的伦理指责。

至于那些开源的TTS，说实话，效果都挺差强人意，比如Tortoise奇慢无比，比如bark下限和稳定性太差，都难堪大用。

大厂们公开的语音产品中，也没有一项能达到11Labs如此便宜且如此便捷的了。要知道，像微软的声音克隆成本高的可怕，数小时的数据集、几千几万块钱。而11Labs，只需要30秒到5分钟的音频，1个月只需要5美刀就可以畅快的使用了。效果还出奇的好。

毕竟在现在这个AI时代，AI语音已经成了最为重要的环节之一。内容全球化翻译、智能配音、数字人与机器人等，都有超强的应用。换句话说，没有强TTS在背后支持，那些视频和数字人，各个都是恐怖谷效应拉满假到不行的哑巴。

而11Lbas的使用上，更是突出一个简单和有手就行。

先准备30秒到5分钟的音频文件，不需要超过5分钟，对质量几乎没有任何意义了。你可以多个音频文件，但是每个不要超过10M。这块一定要注意，数据集的质量跟你后面生成的质量息息相关，里面不要有任何杂音，越干净、越纯粹越好。

上面那个例子，我就去B站扒了点特朗普的演讲视频，然后剪映剪了下，准备了大概4分钟的特朗普的干声数据集，切成了11段。

然后进入11Labs的主页，登录后进入这个VoiceLab的页面。这个页面就可以去做声音的克隆了。那个大大的加号就是新建一个声音。

在弹窗中，第二个选项就是声音克隆。

不过这个功能是付费功能，正常付个费就可以用了。首月优惠1美刀，基本就是白给，可以直接绑定中国境内的VISA就可以支付，比ChatGPT的付费方便多了。

在打开的弹窗上随便输个姓名，把数据集拖进去就行。标签和描述啥的不用填。然后确认。记得一定不要开任何翻译，比如google翻译啥的，要不然会报错。

大概只需要二十几秒钟吧，模型就OK了，速度出奇的快。你就可以直接点Use去使用。

这里再推荐大家几个TTS的小技巧，善用标点符号去引导情绪。

比如这句话：I am Trump . my other name is “Chuan Jian guo”.

直接生成的话会是这样：

把my other name is “Chuan Jian guo”这句话，变成my other name… is “Chuan Jian guo”后，你就能明显听出小停顿的情绪：

如果再把I am Trump后面加三个感叹号，变成I am Trump!!!的话：

这情绪一下就激动了起来。。。

11Labs对这些标点符号的引导非常到位，善用标点符号，能给这段文字带来完整的情绪感受。

在最后，说一下目前AI声音的几种技术和场景吧。

SVC，类似于变声器。将一段音频转换成另一种特定的音色，音频to音频，我也写过一篇教程：用SVC做特定人物AI配音 - 你奶奶都会的AI声音教程，成本挺高的，数十分钟的干声数据集，训练几个小时起步，但是对情绪和音调的还原最好，适合用在剧集配音、歌声转换等场景。不过这块11Labs已经明确要进军了，做语音转换，不知道后面用户的使用成本会拉低到什么地步。

TTS - 声音克隆。将特定的人声训练成模型，然后文字转音频。用于需要特定某个人声的场景、或同声翻译等等，数字人应用的很广泛。成本低，但是对于情绪的变化肯定没有SVC那么强，毕竟几分钟数据集+几乎为0的等待时间，11Labs是典型的王者。

普通TTS。用平台已经训练好的声音做配音，不可自定义，在有声书和视频配音里已经被广泛应用。这块的产品就非常多了，国外的微软TTS、11Labs，国内的魔音工坊等等。

基本就这三种了，SVC和TTS我也写过好多教程了，大家可以根据自己的场景，各取所需。

逸尘的AI知识库

探索

仅需30秒完美复刻任何人的声音___最强AI音频11Labs

仅需30秒完美复刻任何人的声音 - 最强AI音频11Labs

互动数据

关系图谱

目录