三只羊卢总的录音AI到底能不能做出来?我的答案是:当然能。 * { margin: 0; padding: 0; outline: 0; } body { font-family: “PingFang SC”, system-ui, -apple-system, BlinkMacSystemFont, “Helvetica Neue”, “Hiragino Sans GB”, “Microsoft YaHei UI”, “Microsoft YaHei”, Arial, sans-serif; line-height: 1.6; } .__page_content__ { max-width: 667px; margin: 0 auto; padding: 20px; text-size-adjust: 100%; color: rgba(0, 0, 0, 0.9); padding-bottom: 64px; } .title { user-select: text; font-size: 22px; line-height: 1.4; margin-bottom: 14px; font-weight: 500; } .__meta__ { color: rgba(0, 0, 0, 0.3); font-size: 15px; line-height: 20px; hyphens: auto; word-break: break-word; margin-bottom: 50px; } .__meta__ .nick_name { color: 576B95; } .__meta__ .copyright { color: rgba(0, 0, 0, 0.3); background-color: rgba(0, 0, 0, 0.05); padding: 0 4px; margin: 0 10px 10px 0; } blockquote.source { padding: 10px; margin: 30px 0; border-left: 5px solid ccc; color: #333; font-style: italic; word-wrap: break-word; } blockquote.source a { cursor: pointer; text-decoration: underline; } .item_show_type_0 > section { margin-top: 0; margin-bottom: 24px; } a { color: 576B95; text-decoration: none; cursor: default; } .text_content { margin-bottom: 50px; user-select: text; font-size: 17px; white-space: pre-wrap; word-wrap: break-word; line-height: 28px; hyphens: auto; } .picture_content .picture_item { margin-bottom: 30px; } .picture_content .picture_item .picture_item_label { text-align: center; } img { max-width: 100%; } .pay_subscribe_notice { margin: 30px 0; padding: 20px; background: fffbe6; border: 1px solid ffe58f; border-radius: 8px; } .pay_subscribe_badge { display: inline-block; padding: 4px 12px; background: faad14; color: fff; border-radius: 4px; font-size: 14px; font-weight: 500; margin-bottom: 12px; } .pay_subscribe_desc { font-size: 15px; line-height: 1.8; color: rgba(0, 0, 0, 0.7); margin-bottom: 12px; } .pay_subscribe_hint { font-size: 13px; color: rgba(0, 0, 0, 0.4); } .__bottom-bar__ { display: flex; justify-content: space-between; align-items: center; position: fixed; bottom: 0; left: 0; right: 0; height: 64px; padding: 8px 20px; background: white; box-sizing: border-box; border-top: 1px solid rgba(0, 0, 0, 0.2); } .__bottom-bar__ .left { display: flex; align-items: center; font-size: 15px; white-space: nowrap; } .__bottom-bar__ .right { display: flex; } .__bottom-bar__ .sns_opr_btn { display: flex; align-items: center; user-select: none; background: transparent; border: 0; color: rgba(0, 0, 0, 0.9); font-size: 14px; } .__bottom-bar__ .sns_opr_btn:not(:last-child) { margin-right: 16px; } .__bottom-bar__ .sns_opr_btn > img { margin-right: 4px; }

三只羊卢总的录音AI到底能不能做出来?我的答案是:当然能。

原创 数字生命卡兹克 数字生命卡兹克 2024-09-27 09:31 北京

原文地址: https://mp.weixin.qq.com/s/WEzfMvXF6u2TPJ51_nv0hQ

今天凌晨,N多人给我发了一张图,说警方通报了,问我到底怎么看三只羊录音是不是AI这事。

还有朋友跟我说,有个号称国内AI第一人的,之前信誓旦旦的说这录音必不可能是AI,AI做不出来。所以这个通报背后,会不会背后是有些阴谋论?

我差点都喷了,国内AI第一人?我第一反应是院士也下场参加这种无聊的事了?

然后查了一下…哦…算了不提了。

我觉得我有必要科普一下,就是AI到底能不能做到三只羊卢总录音级别?

我可以明确的给你一个回答,是:能。

先简单说下前情提要。

三只羊跟辛巴有一段乱七八糟的风波,反正就是互相掐架,你来我往,好不热闹。

然后风波正甚时,三只羊董事长卢文庆的一段炸裂的录音被全网疯传。

就是这个,我做了删减,其中一些不雅片段我也全部消音处理了。

内容炸裂不堪入耳,信量极大且内容十分惊人,其中涉及权斗、出轨等等等,总结一下就是卢总自爆和三只羊所有女主播有过不正当的关系。还点名看不起张一鸣。。。

大概就是这么个事,然后三只羊就举报了,说这录音是AI合成的。

网上就吵得不可开交了,大部分人最大的理解就是,AI做不出来这种级别的录音,为什么?因为那个“国内AI第一人”说的。

这段录音听着很真实对吧,有情绪有方言有杂音,所以问题其实就是两个,这段录音,到底是不是AI做的?以及,AI到底能不能做到这种级别的录音?

第一个问题,今天已经有了答案,我永远无条件相信我们的公安,他们发布的通报,我也相信就是事实,这个没有任何可以争议的。所以第一个问题的答案相当明确,那就是AI做的。

那么第二个问题,最关键的来了,AI到底能不能做到这种级别的录音。

我的答案,当然能。

首先,我需要在这里科普一下,AI是个大类,而在细分里面还有很多赛道。

有语言大模型(GPT、Claude、豆包等等),有AI绘图(MJ、SD、FLUX等等),有AI音频(11Labs、SVC、GPT-Sovtis、Suno等等)、有AI视频(Runway、可灵、豆包、Pixverse等等)、有AI 3D(TripoAI、Meshy等等)。

而AI音频里,又分为AI生成音乐、AI生成音效、声音克隆。

这个录音,属于声音克隆这个赛道里面的。

所以不要说AI能做出来这个就比OpenAI比ChatGPT还要牛逼,都不是一个赛道的,有啥可比的,就像你说哇这个洗衣机洗衣服真牛逼,比那个冰箱还要牛逼。。。

而声音克隆,又分为两种:TTS(文本生成语音)、SVC(AI换声)。

TTS就是给一段一个人的人声,只要几秒几十秒的素材,就能训练一个AI模型,然后直接用文字就能生成特定人声音音频的语音合成,现在最好的开源项目应该是GPT-sovits。

SVC你就可以通俗的理解成AI换声,就是AI时代的变声器。现在AI变声器领域三个扛把子项目:So-vits-svc、RVC、DDSP。

OK,现在清楚在AI声音克隆领域,也有两种手段来实现声音伪造了吧。

TTS项目,优点是数据要求短,5秒的音频素材就行,就能克隆你的声音,后续只要给文本就能生成音频,成本极低效果极快。但是缺点就是,情绪、停顿、真实度的上限都很低,听个几十秒,就能非常轻松的听出来哦这个是AI味道。

而之前,大家觉得AI做不了卢总的音频伪造,都是先入为主的带入了TTS的思路,觉得一定是用TTS做出来的。

非常坦率的讲,TTS做卢总这种级别的音频,就我所知道的市面上公开的产品(不包括各大公司内部实验室的项目),确实有点难。

但是,思路打开,TTS做不了这个,但是SVC呢?

SVC的缺点,就是成本高,需要起步30分钟的音频数据集,然后跑几个小时的炼丹训练这个人的人声模型,最后还需要再找一个人录一段音频,再用SVC换声,把音色替换过去。

而优点就非常的直白了,这玩意能保留说话人的所有情绪、停顿、语气、方言等等等等,质量上限约等于无限,只要模型好,你根本听不出来这到底是不是AI的。

连歌声都可以无缝换声,换你个说话声音,简直就是个小case了好吧。

去年爆火的AI孙燕姿,就是拿svc做的。

我也写过好几篇关于SVC的教程。

用SVC做特定人物AI配音 - 你奶奶都会的AI声音教程

AI唱歌之终极喂饭教程 - SVC的极限就在这了

也给大家听一下,我用SVC换声后,用我自己的声音替换李荣浩的模特的效果。

这是AI直出,我只加了背景音乐。

这就是SVC。

所以用SVC做卢总的AI音频伪造,步骤也很简单。

1. 从网上收集卢总的30分钟左右说话数据,这个很好找,毕竟他是名人。

2. 用SVC或者RVC,把卢总的声音清洗完,训练成一个AI模型。

**3. 卢总是安庆人,合肥那边安庆人很多,找一个跟他口音差不多的,把需要合成的音频自己先念一遍。
**

4. 最后用SVC的AI模型,把念完的音频替换成他的声音。

女声同理。

至此,完毕。

如果你还想听着真实一点,就用剪映啥的加点风噪环境音,太多了,随便找,你要环境音,传统音频软件能处理,当然,你也可以拿着带环境音的数据集进去训练,虽然我不推荐这么做。。。

特别是原视频那个方式,是把录音发到手机上,再用手机播放,用另一台手机来录,本身环境音就一堆了,还夹在着哥们背景笑声,乱七八糟的。这都属于场外因素了。。。

所以,回到第二个问题,AI能不能做卢总那种的伪造录音?当然能。

不要把AI想的太神话,也别把AI想的太垃圾,人工智能,很多时候是人工+智能。

现在的TTS,解决不了情绪问题,那为啥非要让AI去搞定情绪?

你人工念完了换音色不就行了?这就是人工+智能。

思路打开,不要太局限。

AI是你的助手,是辅助工具,是让你用的,不是让你啥都甩给他当甩手掌柜的。

最后,我想声明一下。

我写下这篇文章,不是让大家去知道这个技术,而去犯法,做一些法外之事,成为法外狂徒。

而是希望做一个关于AI音频的小小科普,抹平信息差,让大家知道有这么个技术,上限就在这,不要觉得AI做不到就可以掉以轻心。而是要知道,现在的AI,可以达到什么地步,什么水平。

在人工+智能的加持下,能做到什么事情。

科技的进步是不可逆的,所有人都是这巨大洪流中的一滴水,只会被裹挟着前行,知道永远比不知道好,知己知彼,方能百战不殆。

我们学习很多东西,学习AI,很多时候,是为了保护我们自己。

还有,保护我们的家人。

然后,更好的生活。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

>/ 作者:卡兹克

>/ 投稿或爆料,请联系邮箱:wzglyay@gmail.com

数字生命卡兹克

![](data:image/svg+xml,%3Csvg xmlns=‘http://www.w3.org/2000/svg’ width=‘24’ height=‘24’ viewBox=‘0 0 24 24’%3E%3C!— Icon from Lucide by Lucide Contributors - https://github.com/lucide-icons/lucide/blob/main/LICENSE —%3E%3Cg fill=‘none’ stroke=‘%23888888’ stroke-linecap=‘round’ stroke-linejoin=‘round’ stroke-width=‘2’%3E%3Cpath d=‘M2.062 12.348a1 1 0 0 1 0-.696a10.75 10.75 0 0 1 19.876 0a1 1 0 0 1 0 .696a10.75 10.75 0 0 1-19.876 0’/%3E%3Ccircle cx=‘12’ cy=‘12’ r=‘3’/%3E%3C/g%3E%3C/svg%3E) 阅读![](data:image/svg+xml,%3Csvg width=‘25’ height=‘24’ viewBox=‘0 0 25 24’ fill=‘none’ xmlns=‘http://www.w3.org/2000/svg’%3E%3Cpath fill-rule=‘evenodd’ clip-rule=‘evenodd’ d=‘M16.154 6.797l-.177 2.758h4.009c1.346 0 2.359 1.385 2.155 2.763l-.026.148-1.429 6.743c-.212.993-1.02 1.713-1.977 1.783l-.152.006-13.707-.006c-.553 0-1-.448-1-1v-8.58a1 1 0 0 1 1-1h2.44l1.263-.03.417-.018.168-.015.028-.005c1.355-.315 2.39-2.406 2.58-4.276l.01-.16.022-.572.022-.276c.074-.707.3-1.54 1.08-1.883 2.054-.9 3.387 1.835 3.274 3.62zm-2.791-2.52c-.16.07-.282.294-.345.713l-.022.167-.019.224-.023.604-.014.204c-.253 2.486-1.615 4.885-3.502 5.324l-.097.018-.204.023-.181.012-.256.01v8.218l9.813.004.11-.003c.381-.028.72-.304.855-.709l.034-.125 1.422-6.708.02-.11c.099-.668-.354-1.308-.87-1.381l-.098-.007h-5.289l.26-4.033c.09-1.449-.864-2.766-1.594-2.446zM7.5 11.606l-.21.005-2.241-.001v8.181l2.45.001v-8.186z’ fill=‘%23000’/%3E%3C/svg%3E) 赞 ![](data:image/svg+xml;charset=utf8,%3Csvg xmlns=‘http://www.w3.org/2000/svg’ width=‘24’ height=‘24’ viewBox=‘0 0 24 24’%3E %3Cg fill=‘none’ fill-rule=‘evenodd’%3E %3Cpath d=‘M0 0h24v24H0z’/%3E %3Cpath fill=‘%23576B95’ d=‘M13.707 3.288l7.171 7.103a1 1 0 0 1 .09 1.32l-.09.1-7.17 7.104a1 1 0 0 1-1.705-.71v-3.283c-2.338.188-5.752 1.57-7.527 5.9-.295.72-1.02.713-1.177-.22-1.246-7.38 2.952-12.387 8.704-13.294v-3.31a1 1 0 0 1 1.704-.71zm-.504 5.046l-1.013.16c-4.825.76-7.976 4.52-7.907 9.759l.007.287c1.594-2.613 4.268-4.45 7.332-4.787l1.581-.132v4.103l6.688-6.623-6.688-6.623v3.856z’/%3E %3C/g%3E%3C/svg%3E) 分享 ![](data:image/svg+xml;charset=utf8,%3Csvg xmlns=‘http://www.w3.org/2000/svg’ xmlns:xlink=‘http://www.w3.org/1999/xlink’ width=‘24’ height=‘24’ viewBox=‘0 0 24 24’%3E %3Cdefs%3E %3Cpath id=‘a62bde5b-af55-42c8-87f2-e10e8a48baa0-a’ d=‘M0 0h24v24H0z’/%3E %3C/defs%3E %3Cg fill=‘none’ fill-rule=‘evenodd’%3E %3Cmask id=‘a62bde5b-af55-42c8-87f2-e10e8a48baa0-b’ fill=‘%23fff’%3E %3Cuse xlink:href=‘%23a62bde5b-af55-42c8-87f2-e10e8a48baa0-a’/%3E %3C/mask%3E %3Cg mask=‘url(%23a62bde5b-af55-42c8-87f2-e10e8a48baa0-b)‘%3E %3Cg transform=‘translate(0 -2.349)‘%3E %3Cpath d=‘M0 2.349h24v24H0z’/%3E %3Cpath fill=‘%23576B95’ d=‘M16.45 7.68c-.954 0-1.94.362-2.77 1.113l-1.676 1.676-1.853-1.838a3.787 3.787 0 0 0-2.63-.971 3.785 3.785 0 0 0-2.596 1.112 3.786 3.786 0 0 0-1.113 2.687c0 .97.368 1.938 1.105 2.679l7.082 6.527 7.226-6.678a3.787 3.787 0 0 0 .962-2.618 3.785 3.785 0 0 0-1.112-2.597A3.687 3.687 0 0 0 16.45 7.68zm3.473.243a4.985 4.985 0 0 1 1.464 3.418 4.98 4.98 0 0 1-1.29 3.47l-.017.02-7.47 6.903a.9.9 0 0 1-1.22 0l-7.305-6.73-.008-.01a4.986 4.986 0 0 1-1.465-3.535c0-1.279.488-2.56 1.465-3.536A4.985 4.985 0 0 1 7.494 6.46c1.24-.029 2.49.4 3.472 1.29l.01.01L12 8.774l.851-.85.01-.01c1.046-.951 2.322-1.434 3.59-1.434 1.273 0 2.52.49 3.472 1.442z’/%3E %3C/g%3E %3C/g%3E %3C/g%3E%3C/svg%3E) 推荐 ![](data:image/svg+xml,%3Csvg width=‘25’ height=‘24’ viewBox=‘0 0 25 24’ fill=‘none’ xmlns=‘http://www.w3.org/2000/svg’%3E%3Cpath d=‘M22.242 7a2.5 2.5 0 0 0-2.5-2.5h-14a2.5 2.5 0 0 0-2.5 2.5v8.5a2.5 2.5 0 0 0 2.5 2.5h2.5v1.59a1 1 0 0 0 1.707.7l1-1a.569.569 0 0 0 .034-.03l1.273-1.273a.6.6 0 0 0-.8-.892v-.006L9.441 19.1l.001-2.3h-3.7l-.133-.007A1.3 1.3 0 0 1 4.442 15.5V7l.007-.133A1.3 1.3 0 0 1 5.742 5.7h14l.133.007A1.3 1.3 0 0 1 21.042 7v4.887a.6.6 0 1 0 1.2 0V7z’ fill=‘%23000’ fill-opacity=’.9’/%3E%3Crect x=‘14.625’ y=‘16.686’ width=‘7’ height=‘1.2’ rx=’.6’ fill=‘%23000’ fill-opacity=’.9’/%3E%3Crect x=‘18.725’ y=‘13.786’ width=‘7’ height=‘1.2’ rx=’.6’ transform=‘rotate(90 18.725 13.786)’ fill=‘%23000’ fill-opacity=’.9’/%3E%3C/svg%3E) 留言