Загрузка видео...

Не удалось загрузить видео

На главную

阿里的这个项目牛P啊 OmniTalker:只用一段“参考视频”就能学会视频里人物说话 并保持唇形同步和表情 也就是你给它一段视频它可以同时提取视频中人物的说话风格和面部表情。 比如你给它一段罗翔的视频),它就能学会“罗翔是怎么说话、什么表情”,然后你随便给它什么文字,它就用这种风格去说话。 不用你训练模型、调参数,也不用配音演员,全自动!

244,871 просмотров • 1 год назад •via X (Twitter)

Комментарии: 7

Фото профиля 小互
小互1 год назад

过去做这种说话视频,需要 好几个步骤拼起来,容易: 出错(声音和表情不同步) 风格不一致(说得像机器人) 慢(处理流程长) OmniTalker 的创新点在于: 它把这一切都整合到一个大模型里,一次性完成,听起来更自然,嘴型和语气完全匹配,还能“模仿风格”。

Фото профиля 小互
小互1 год назад

可生成较长的视频内容,同时保持语气、节奏、动作风格的一致性。 还支持情绪控制和5 帧/秒(FPS)的实时生成。 详细介绍:

Фото профиля 小互
小互1 год назад

这个很让人感触啊↓

Фото профиля 沉稳的小华
沉稳的小华1 год назад

这个和剪映的 自定义数字人+文案+克隆声音一样

Фото профиля 沉稳的小华
沉稳的小华1 год назад

知道有用AI生成音乐,并可以把声音替换自己克隆的声音的AI工具吗?感谢~

Фото профиля バシロウ
バシロウ1 год назад

以後做視頻不用錄了,直接給它文案就好

Фото профиля Solar Heavy
Solar Heavy2 лет назад

who do these vocals remind you of?

Похожие видео

学AI半年还在纠结用哪个工具,你不是不会,是在用准备逃避开始 一个零基础就能用的方法,四步闭环 ① 工具准备 下两个免费 APP,Workbody 和 Coder Work,现在有羊毛薅,每天送积分,足够你用 不用配环境,拿来就用。别一上来就纠结 Claude Code、Codex,那些以后再说 ② 建档案 打开以后直接告诉 AI:你是谁、干嘛的、优点、缺点、目标、卡点 把它当几十万的咨询顾问,把你的底牌摊给它,让它记住你。然后说:以后我需要你给建议、给方法、帮我朝目标走 ③ 喂内容 网上看到好东西,不要点收藏 收藏有个屁用,点完就是心理安慰 好文章直接复制给 AI,好视频好音频把链接扔给它。然后说:这个内容我觉得好,好在哪我想了想,你帮我看看,根据我的情况怎么用 它会告诉你哪些现在就能用,一二三列出来,照做。哪些以后能用,整理成知识块存起来,到时候拿出来 ④ 每天复盘 用完跟 AI 说:我是这么用的,结果是这样,你给我复盘,告诉我下面怎么改进 一天两天三天四天五天,你就和别人完全不一样了 然后你会发现,那个不会用的 Claude Code,你问它,它就告诉你怎么用。Codex 不会用,它也告诉你怎么用 一定是先用出来 很多人学东西学傻了,一定要先学会了再用 打球的方法是什么?先上场。不是在网上看十年教学视频,看了十年还不会打球 先上场,边学边用,甚至你都不需要懂,干就完了

熊三金Cole

10,901 просмотров • 2 месяцев назад

卧槽,Hypit 这次确实有点意思。 把它接进 Codex,丢一条参考视频过去,再说一句“帮我 Clone”,它就能把原片拆成可编辑的视频工程。 人物能换、服装能换、色卡能换。 原片的构图、镜头节奏、字幕、转场和画面层级,会尽量保留下来。 我这次用 Codex 跑了 Hypit,复刻了两条短视频。 一个是「豆包帮我清理桌面」的场景创意 yanhua,一个是 @陶阿狗君 的旅行变装。 它先把视频拆成一个可编辑的 workflow。 谁在说话、哪一段用什么图、字幕怎么排、画面怎么动,都变成工程里的零件。 流程很简单: 1、给 Codex 装上 Hypit Skill npx skills add hypit-ai/hypit -g 2、配好视频模型 API 我这里用即梦 CLI 调 Seedance,先确认模型能正常出片。 3、把参考视频和人物图交给 Codex 告诉它保留原片构图和分镜节奏,把人物换成参考图角色,再生成新的色卡和服装。 4、先确认图片,再生成动态镜头 图片、视频和声音可以分阶段处理。图片不满意先改,确认后再调视频模型出片。 我觉得 Hypit 最有意思的地方,是它把视频制作从一次性「抽卡」,变成可以持续修改的项目。 你能一边预览成片,一边看对应素材和源码。想换人、改字、调镜头节奏,都有地方下手。 工具是开源的,模型和 API 费用各自另算。 想用 AI Agent 做视频 Clone 的,可以自己装了试试,效果因模型和参考片差异会比较大。 官方仓库(开源):

行者AI视频

159,417 просмотров • 17 дней назад

怎么用 MiniMax H3 做多人对话短剧,难点在哪、怎么解决,一个视频讲清楚。 H3 做长视频两个坑:段一多人就换脸,段和段接不上。 这条用 MiniMax Design 把坑填平,过程看视频👇。 H3 开源之后火到什么程度不用我说,有能力的同学显卡一张接一张往机器里插,我自己也在 4090 上跑了一段时间。但更多人卡在部署那一步,显存、环境、提示词格式,每一关都能把人劝退。 官方出了个 MiniMax Design,把 H3 装进了一个 agent 里。不用部署,不用学提示词格式,你说要什么,它自己出图、生视频、剪辑,Mac 和 Windows 都能安装。 我拿它做了一条 2 分 05 秒、4 个角色、12 段一镜到底的短剧,从头到尾没换过脸。全过程我录了一遍,就在这条视频里: 🔹 剧本和 22 张连续状态图我在外面先做好,每一段的首帧和尾帧都是这 22 张里的图,上一段的尾帧就是下一段的首帧。人物不换脸就靠这个,只用文字描述,写得再细,下一段还是另一个人。 🔹 拖进 Design 的画布,每段挂一张首帧、一张尾帧,写好台词和动作。第一段出来,三个人就是图上的三个人,台词一字不差,对白是它自己生成的,没有配音。剩下十一段分三批,它自己排队跑。 🔹 多人镜头先在 3D 导演台摆站位和机位。把病房平面图丢给它,它自己搭房间、把人放进去,四个人谁站哪、相机放哪,转一圈看站位,不对的选中人物按键转过来,不用重跑。 🔹 12 段进视频剪辑,拼接、字卡、字幕、片名。11 条接缝用了六种接法,哪种情况用哪种,视频后半段一条一条过。 成片在下一条👇

huangserva

63,397 просмотров • 26 дней назад

说实话,这个数字人项目被严重低估了。 外面还在20美元/月买 HeyGen数字人会员,美团已经把整套数字人口播方案开源出来了。叫 InfiniteTalk,一张图一段话,口型、头、身体全同步,不限时长。老王拿照片试了一下,完全可用。 它表面是个数字人对口型工具,实际干的事比这多得多。底层用Wan视频模型负责出画面,再挂个音频分析引擎,把你说的每句话拆成嘴型、表情、身体该怎么动的指令,最后靠一种只刷新关键帧的策略,保人脸不崩背景不乱。 整条视频从上到下跟着音频走,不光嘴在动,肩膀、眉毛、眼神全跟着语音节奏变。那种只给你换张嘴的方案。 有两种用法。 1、拍张照片配段话扔进去,出来就是一条完整的说话视频,单人口播、唱歌都行。 2、塞段现成视频加段新音频进去,它能给原视频换配音,人物嘴型和身体动作全跟着新音频重新对齐。 硬件要求,英伟达cuda,显存至少24G,mac无法使用,内存32G以上,硬盘200G以上(权重就100G以上) 安装方法,不复杂, 让AI帮你建个新 Python 环境,跑一遍依赖清单,从 HuggingFace 拽三个模型包就齐了。从下载到出第一条视频,半小时够了。 PS:仓库在 GitHub,而且是Apache-2.0 协议,商用很友好。效果看这个视频,开源的东西做到这个程度,以前真不敢想。

产品经理老王霸

90,306 просмотров • 3 месяцев назад