Загрузка видео...

Не удалось загрузить видео

На главную

阿里的这个项目牛P啊 OmniTalker:只用一段“参考视频”就能学会视频里人物说话 并保持唇形同步和表情 也就是你给它一段视频它可以同时提取视频中人物的说话风格和面部表情。 比如你给它一段罗翔的视频),它就能学会“罗翔是怎么说话、什么表情”,然后你随便给它什么文字,它就用这种风格去说话。 不用你训练模型、调参数,也不用配音演员,全自动!

244,802 просмотров • 1 год назад •via X (Twitter)

Комментарии: 7

Фото профиля 小互
小互1 год назад

过去做这种说话视频,需要 好几个步骤拼起来,容易: 出错(声音和表情不同步) 风格不一致(说得像机器人) 慢(处理流程长) OmniTalker 的创新点在于: 它把这一切都整合到一个大模型里,一次性完成,听起来更自然,嘴型和语气完全匹配,还能“模仿风格”。

Фото профиля 小互
小互1 год назад

可生成较长的视频内容,同时保持语气、节奏、动作风格的一致性。 还支持情绪控制和5 帧/秒(FPS)的实时生成。 详细介绍:

Фото профиля 小互
小互1 год назад

这个很让人感触啊↓

Фото профиля 沉稳的小华
沉稳的小华1 год назад

这个和剪映的 自定义数字人+文案+克隆声音一样

Фото профиля 沉稳的小华
沉稳的小华1 год назад

知道有用AI生成音乐,并可以把声音替换自己克隆的声音的AI工具吗?感谢~

Фото профиля バシロウ
バシロウ1 год назад

以後做視頻不用錄了,直接給它文案就好

Фото профиля Solar Heavy
Solar Heavy2 лет назад

who do these vocals remind you of?

Похожие видео

说实话,这个数字人项目被严重低估了。 外面还在20美元/月买 HeyGen数字人会员,美团已经把整套数字人口播方案开源出来了。叫 InfiniteTalk,一张图一段话,口型、头、身体全同步,不限时长。老王拿照片试了一下,完全可用。 它表面是个数字人对口型工具,实际干的事比这多得多。底层用Wan视频模型负责出画面,再挂个音频分析引擎,把你说的每句话拆成嘴型、表情、身体该怎么动的指令,最后靠一种只刷新关键帧的策略,保人脸不崩背景不乱。 整条视频从上到下跟着音频走,不光嘴在动,肩膀、眉毛、眼神全跟着语音节奏变。那种只给你换张嘴的方案。 有两种用法。 1、拍张照片配段话扔进去,出来就是一条完整的说话视频,单人口播、唱歌都行。 2、塞段现成视频加段新音频进去,它能给原视频换配音,人物嘴型和身体动作全跟着新音频重新对齐。 硬件要求,英伟达cuda,显存至少24G,mac无法使用,内存32G以上,硬盘200G以上(权重就100G以上) 安装方法,不复杂, 让AI帮你建个新 Python 环境,跑一遍依赖清单,从 HuggingFace 拽三个模型包就齐了。从下载到出第一条视频,半小时够了。 PS:仓库在 GitHub,而且是Apache-2.0 协议,商用很友好。效果看这个视频,开源的东西做到这个程度,以前真不敢想。

产品经理老王霸

88,174 просмотров • 1 месяц назад