Загрузка видео...

Не удалось загрузить видео

На главную

ElevenLabs 推出 Dubbing V2 端到端的AI配音模型... 最大的变化:配音不再是"先转写、再翻译、最后合成"三段式拼接,而是模型直接基于原始表演建模声音。 并将音色、情绪、演绎都跟着穿越进每一种语言 也就是说,同一个人开口讲六国语言,听上去还是他本人,连情绪和呼吸节奏都对得上 Dubbing v2 支持 90 多种语言和口音, 原理:它针对原始表演来生成,而不是针对一段转录文本,所以语气、情绪、表达方式会跨语言保留下来,声音克隆全自动,会给原说话人建一个声音模型并应用到所有目标语言,保留身份、音高和语气,不用手动设置。 另外支持音频、视频和文字三种输入 具体能力: • 音色穿越:不是模仿你的声音,是你的声音直接在另一种语言里说话 • 情绪保真:原片里你笑你叹气你激动,译版照样有 • 同步感知翻译:译文长度匹配原片口型和停顿,不会嘴动完了字幕还在跑 • 措辞本地化:不是字面直译,每种语言用自己的表达方式 • 端到端全自动:传一个视频进去出一份配音,中间没有手工拼接 视频里他们演了三个场景: MrBeast 风格的荒岛求生在 English/German/French 之间无缝切换 一段财务部门的快节奏对白试连贯性 一个童话故事试表达力

12,522 просмотров • 4 месяцев назад •via X (Twitter)

Комментарии: 12

Фото профиля 小互
小互4 месяцев назад

未来 7 天内,可以免费开始使用: 免费计划提供 1 分钟免费时长 入门计划提供 15 分钟免费时长 创作者+ 计划提供 30 分钟免费时长 详细:

Фото профиля 易小维
易小维4 месяцев назад

这厉害了,如果Youtube官方用上,岂不是和X一样,所有人听到的都是自己国家的语言了??

Фото профиля khalil_tech
khalil_tech4 месяцев назад

刷到这条推马上用了一下 确实牛逼啊

Фото профиля Zippy
Zippy4 месяцев назад

feels like we just unlocked “acting multilingual” without the actor actually learning any

Фото профиля Resona
Resona4 месяцев назад

总感觉elevenlabs像是默默放大招的感觉

Фото профиля Shara
Shara4 месяцев назад

ElevenLabs Dubbing v2 no longer three-step patchwork end-to-end model is the architecture shift

Фото профиля 狐狸狼
狐狸狼4 месяцев назад

端到端语音确实是方向,这次直接跳过文本中转,能完美保留原始语气和情绪。相比单纯的翻译,这种对呼吸节奏和微小停顿的克隆,才是让配音跨越语言障碍、听起来像真人的灵魂所在。

Фото профиля Alex | WaveShift
Alex | WaveShift4 месяцев назад

我也自己开发了一个,虽然没有11lab这么牛,但胜在便宜

Фото профиля Funny
Funny4 месяцев назад

这一步有点吓人:配音终于不再像“另一个人在翻译你”,而像你本人突然多长了几套语言神经。它解决的不是发音问题,是表演连续性问题。以后跨语言内容的门槛会低很多,但观众还能不能分清“翻译过的你”和“被重建的你”?

Фото профиля Fisher Museum of Art
Fisher Museum of Art4 месяцев назад

太牛逼了

Фото профиля Andy Lam
Andy Lam4 месяцев назад

廣東話表現好嗎?

Фото профиля Vigo Zhao
Vigo Zhao4 месяцев назад

在视频上看,很想一个人说了六国语言,感觉在嘴部动作和呼吸和情绪基本一致

Похожие видео

阿里刚刚一口气发了五款语音模型:Qwen-Audio-3.1系列,并全线降价,ASR降95%、Realtime降85%、TTS降70% 同时覆盖理解、生成、创作、实时交互的完整链条。阿里这次直接打出了语音模型的三板斧:能力全栈化、价格断崖下探、语音被推到Agent/硬件入口位置 它这次的Realtime不是只会聊天,是全双工可打断、能识别情绪、能多语言切换,还能调用工具,这就会把语音从搜索式问答推向事务式对话 实时语音从“功能”变成“交互入口”,直接冲击客服、助手以及硬件,AI眼镜、办公Agent、硬件结合等无屏化任务场景或将迎来一波热潮 ASR:能转写30种语言+16种中文方言、原生转写润色(去语气词/重复、语义重组)、分角色转写(谁在什么时候说了什么,带时间戳,支持插话/重叠语音)、流式低延迟(首字约160毫秒) ASR-Next:从“语音转文字”扩展到“理解整个音频”,能听出情绪、环境声、机械声,理解事件时间、进行音频问答 TTS:重点是同一音色跨语言/方言不变味,还能控制情绪和语速 TTS-Next:这个比较狠,从“配音”升级到“做完整音频作品”,一次生成人声、音效、环境音,多角色音色一致、全程不变声;48kHz输出 直接瞄准播客、有声书、影视、游戏、广告等场景 Realtime:全双工,可同时说和听,可打断、能共情、能无缝切换语言、对话中能调用Agent工具完成任务 #阿里语音模型 #QwenAudio

AIGCLINK

16,238 просмотров • 10 дней назад