美团开源LongCat-Video-Avatar 1.5 应该是目前最佳的开源虚拟人模型,音频驱动生成视频。 项目地址: 模型:

Gorden Sun's profile picture

Gorden Sun

11,712 views • 2 months ago

LiveAvatar:阿里夸克开源的实时虚拟人模型 能实时生成虚拟人视频(需要5个H800),能生成无限长度的视频且画质不降低。 模型: 项目地址:

Gorden Sun's profile picture

Gorden Sun

21,635 views • 8 months ago

Fun-CineForge:阿里开源的AI生成影视配音 输入视频+文本,AI生成配音,能识别多个角色,能按要求设置配音风格,生成的配音节奏与视频里说话的唇形同步。演示视频的声音效果非常好。 项目地址: 模型:

Gorden Sun's profile picture

Gorden Sun

27,036 views • 4 months ago

阿里马上要发一款语音到视频的模型,WAN 2.2-S2V,把说话声音变成高级影片 由音频驱动,基于视觉构建 开源 #语音生成AI视频

AIGCLINK's profile picture

AIGCLINK

14,386 views • 11 months ago

登顶AI视频制作第一的Happy Horse 1.0 声称是Happy Horse 团队开源的15B开源模型,官网直达

老张来了's profile picture

老张来了

64,686 views • 4 months ago

字节、港中文等最新搞了一个专用于人-物交互的端到端视频生成模型:OmniShow,妥妥的电商广告专用模型 全模态,一个模型通吃图+音+姿势+文本输入 任务可以覆盖R2V、RA2V、RP2V、RAP2V四种生成模式,目前应该是唯一一个支持同时用图像+音频+姿势+文本混合输入的 人脸保持、物理合理性、表现力及口型同步看起来效果都还可以 原生长镜头生成,最长可生成10秒连续视频 目前代码还没放出来 #人物视频生成模型 #OmniShow #电商视频生成

AIGCLINK's profile picture

AIGCLINK

22,713 views • 3 months ago

发现一个开源的 AI 视频生成项目,GitHub 已经 7k star 了——InfiniteTalk 它支持图像转视频和视频转视频两种模式,都是语音驱动的。 给一张图片加一段音频,能直接生成说话的视频;给一段已有视频换音频,也能重新配音。...

阿西_出海's profile picture

阿西_出海

19,872 views • 1 month ago

字节的音频驱动肖像视频生成模型:Loopy,效果看起来非常赞 人物表情动作很到位,叹气、情绪、眉毛眼睛的动作看起来非常自然,可以用于比如虚拟主播、视频聊天、游戏角色等 特点: 1、无需手动指定运动模板:支持根据音频自动生成自然流畅的运动 2、效果逼真: 生成的视频非常自然、生动,接近真实场景 同类项目,比如有Emo、VASA-1、Hedra、HeyGen Expressive Photos等 项目:

AIGCLINK's profile picture

AIGCLINK

27,425 views • 1 year ago

我去,美团把数字人视频生成模型开源了。外面数字人 Agent 一天卖 50 万,美团直接做了个 LongCat-Video-Avatar 塞进同一个仓库里开源了。 给一张人脸图加一段音频,数字人张嘴念稿,嘴唇、眼神、表情全自动对上。 它不是那种玩具开源,是实打实对标...

产品经理老王霸's profile picture

产品经理老王霸

170,032 views • 1 month ago

发现一个超牛逼的开源项目,让你的AI直接掌握各大网站的设计风格,例如 Apple、Claude、Stripe等等,才开源三天就拿到了17K star。 我用MiniMax (official) 的 M2.7 模型,要求参考 Spotify...

超级个体 Austin's profile picture

超级个体 Austin

84,830 views • 4 months ago

听说短剧公司都在搞Minimax H3 本地版 这是视频生成的 Deepseek 时刻 音视频同出,中国的蒜真的不一样 这蒜力,拿来做口播,要起飞 口播的几个流派:...

实践哥MinLi's profile picture

实践哥MinLi

32,920 views • 1 day ago

谷歌也发布了一个根据输入图片和音频就能生成对应人物讲话视频的项目VLOGGER。看起来没有阿里那个自然。 项目简介: 它可以根据一张人物图像,生成由文本和音频驱动的说话人视频。该方法建立在最近生成式扩散模型取得成功的基础之上。 VLOGGER 包含两个关键组件: 1) 一个随机的人体到 3D 运动的扩散模型;...

歸藏(guizang.ai)'s profile picture

歸藏(guizang.ai)

31,171 views • 2 years ago

EchoMimicV2:生成数字人 相比v1版本,从数字脸扩展为数字人,输入1张图+1段手势视频+1段音频,即可生成数字人说该音频的、带手势、带头部动作的视频。 项目地址: Github:

Gorden Sun's profile picture

Gorden Sun

38,581 views • 1 year ago

🤣来了朋友们!!!现在可以用 AuraSR 在 ComfyUI 中放大视频了! AuraSR in ComfyUI 插件已上线!优化了模型加载和自动配置文件,可以同时...

-Zho-'s profile picture

-Zho-

10,328 views • 2 years ago

我的视频复刻Skill在Sol模型的加持下,现在非常牛逼,只要你觉得某个视频是Remotion或者Hyperframes做的,都能复刻。 评论区还有视频样例和开源地址

雪踏乌云's profile picture

雪踏乌云

23,591 views • 23 days ago

开源一个数据可视化的库! 部分效果如下 👇 代码/提示词全开源, 即拿即用! 项目地址:

木子不写代码's profile picture

木子不写代码

11,683 views • 4 months ago

现在头部大模型厂商在 Chat 界面都能所见即所得的生成网页了,那么有没有开源替代呢?我找到了一个—— davia 这个项目使用 FastAPI 构建,直接 pip install...

karminski-牙医's profile picture

karminski-牙医

21,887 views • 1 year ago

Grok imagine 我觉得是我们用得起的 能交付给客户的目前市面上 性价比最高的 视频模型!

虎小象's profile picture

虎小象

21,055 views • 1 month ago

腾讯混元发布视频生成大模型,千题盲测第一,现已全面开源 模型特点: (1)超写实质感:模型生成的视频内容具备高清质感、真实感,可用于工业级商业场景例如广告宣传、创意视频生成等商业应用。 (2)高语义遵循:用户可以进行细致的刻画,例如生成主体的细节,人物概念的组合等。模型可以准确的表达出文本的内容。 (3)运动画面流畅:可生成大幅度的合理运动,运动镜头流畅、符合物理规律,不易变形。 (4)原生镜头转换:模型原生具备自动生成多视角同主体的镜头切换画面,增强画面叙事感。

orange.ai's profile picture

orange.ai

46,147 views • 1 year ago