正在加载视频...

视频加载失败

请问这个视频的中文配音都是AI翻译的吗?如果是的话用的是哪家的TTS技术呀? 来源:

924,840 次观看 • 2 年前 •via X (Twitter)

12 条评论

宝玉 的头像
宝玉2 年前

把部分答案整理一下: 来自原作者评论:翻译+克隆语音+换嘴型 但没有具体模型

宝玉 的头像
宝玉2 年前

Whisper识别 tortoise-tts 合成带原始说话人音色的语音 wav2lip 换嘴型

宝玉 的头像
宝玉2 年前

付费方案:HeyGen 开源方案: 语音转文字:whisper 文字翻译:GPT 声音克隆+生成音频:so-vits-svc 嘴型视频:GeneFace++

宝玉 的头像
宝玉2 年前

ElevenLabs

宝玉 的头像
宝玉2 年前

Rask AI

宝玉 的头像
宝玉2 年前

HeyGen

Solar Heavy 的头像
Solar Heavy1 年前

these vocals are something else

Rainier 的头像
Rainier2 年前

这个工作量应该不小的。这个里面大概经过了语音识别,这个应该是Whisper。 然后是做了一部分都voice clone,提取语音的音色等参数,然后再把数据给 tortoise-tts 合成带原始说话人音色的语音。然后还要做一部分的 lipsync。这个估计是拿wav2lip做的。 整个工作需要大量的算力,很难做到实时,但是随着算力提高,可以做到实时,成本也会大幅降低,这个东西危害性极大。可以说是搞电诈,造假消息的利器。

Axton 的头像
Axton2 年前

Heygen 差不多吧?以下是我以前做过的一个测试片段,效果还是很不错的,除了口型(和脖子🤣)稍微有点僵硬。 原始视频是:

海拉鲁编程客 的头像
海拉鲁编程客2 年前

好像是 MockingBird, 我等会试一下.

Colintheballing 的头像
Colintheballing2 年前

伯明翰刀哥,用的

宝玉 的头像
宝玉2 年前

赞,这个视频和语音对齐似乎还不够好,可能和视频也有关系

相关视频