LiveAvatar:阿里夸克开源的实时虚拟人模型 能实时生成虚拟人视频(需要5个H800),能生成无限长度的视频且画质不降低。 模型: 项目地址:

Gorden Sun
21,635 Aufrufe • vor 8 Monaten
美团开源LongCat-Video-Avatar 1.5 应该是目前最佳的开源虚拟人模型,音频驱动生成视频。 项目地址: 模型:

Gorden Sun
11,788 Aufrufe • vor 2 Monaten
Fun-CineForge:阿里开源的AI生成影视配音 输入视频+文本,AI生成配音,能识别多个角色,能按要求设置配音风格,生成的配音节奏与视频里说话的唇形同步。演示视频的声音效果非常好。 项目地址: 模型:

Gorden Sun
27,036 Aufrufe • vor 5 Monaten
谷歌也发布了一个根据输入图片和音频就能生成对应人物讲话视频的项目VLOGGER。看起来没有阿里那个自然。 项目简介: 它可以根据一张人物图像,生成由文本和音频驱动的说话人视频。该方法建立在最近生成式扩散模型取得成功的基础之上。 VLOGGER 包含两个关键组件: 1) 一个随机的人体到 3D 运动的扩散模型;... show more

歸藏(guizang.ai)
31,195 Aufrufe • vor 2 Jahren
发现一个开源的 AI 视频生成项目,GitHub 已经 7k star 了——InfiniteTalk 它支持图像转视频和视频转视频两种模式,都是语音驱动的。 给一张图片加一段音频,能直接生成说话的视频;给一段已有视频换音频,也能重新配音。... show more

阿西_出海
20,053 Aufrufe • vor 1 Monat
听说短剧公司都在搞Minimax H3 本地版 这是视频生成的 Deepseek 时刻 音视频同出,中国的蒜真的不一样 这蒜力,拿来做口播,要起飞 口播的几个流派:... show more

实践哥MinLi
34,687 Aufrufe • vor 8 Tagen
这数字人效果看起来也太真实了 这是一个叫Tavus的产品,整合了视觉、语音和情感智能,让虚拟人拥有情感表达、情感理解能力 由三个核心模型组成 1、Phoenix-3 实时全脸渲染模型,能生成复杂的微表情和情绪,包括眉毛、脸庞、眼睛等,可以实时调整表情 2、Raven-0 能持续处理视觉上下文,读取情绪,理解情绪变化,并智能回应 3、Sparrow-0 用来控制对话的节奏,判断什么时候该说、什么时候该听,响应速度快... show more

AIGCLINK
28,779 Aufrufe • vor 1 Jahr
国内也有自己的 Veo 3 模型了! 通义今天发布了通义万象 2.5 视频模型 一个重要的更新就是实现音画同步的视频生成能力 支持端到端输出与视频相关的音效、语音,同时可以唇形同步。

歸藏(guizang.ai)
15,388 Aufrufe • vor 10 Monaten
字节、港中文等最新搞了一个专用于人-物交互的端到端视频生成模型:OmniShow,妥妥的电商广告专用模型 全模态,一个模型通吃图+音+姿势+文本输入 任务可以覆盖R2V、RA2V、RP2V、RAP2V四种生成模式,目前应该是唯一一个支持同时用图像+音频+姿势+文本混合输入的 人脸保持、物理合理性、表现力及口型同步看起来效果都还可以 原生长镜头生成,最长可生成10秒连续视频 目前代码还没放出来 #人物视频生成模型 #OmniShow #电商视频生成

AIGCLINK
22,713 Aufrufe • vor 4 Monaten
字节的音频驱动肖像视频生成模型:Loopy,效果看起来非常赞 人物表情动作很到位,叹气、情绪、眉毛眼睛的动作看起来非常自然,可以用于比如虚拟主播、视频聊天、游戏角色等 特点: 1、无需手动指定运动模板:支持根据音频自动生成自然流畅的运动 2、效果逼真: 生成的视频非常自然、生动,接近真实场景 同类项目,比如有Emo、VASA-1、Hedra、HeyGen Expressive Photos等 项目:

AIGCLINK
27,425 Aufrufe • vor 1 Jahr
阿里马上要发一款语音到视频的模型,WAN 2.2-S2V,把说话声音变成高级影片 由音频驱动,基于视觉构建 开源 #语音生成AI视频

AIGCLINK
14,386 Aufrufe • vor 11 Monaten
腾讯混元发布视频生成大模型,千题盲测第一,现已全面开源 模型特点: (1)超写实质感:模型生成的视频内容具备高清质感、真实感,可用于工业级商业场景例如广告宣传、创意视频生成等商业应用。 (2)高语义遵循:用户可以进行细致的刻画,例如生成主体的细节,人物概念的组合等。模型可以准确的表达出文本的内容。 (3)运动画面流畅:可生成大幅度的合理运动,运动镜头流畅、符合物理规律,不易变形。 (4)原生镜头转换:模型原生具备自动生成多视角同主体的镜头切换画面,增强画面叙事感。

orange.ai
46,147 Aufrufe • vor 1 Jahr
一款轻量级、能在移动设备上实时运行的数字人模型:Ultralight-Digital-Human 需要准备一段3到5分钟的视频,视频中的人物需要全程露脸,声音清晰无噪音 项目提供了一个康辉老师的口播示例,整体看起来流畅自然,没有明显的卡顿 github: #数字人 (视频做为该项目效果演示,侵删)

AIGCLINK
55,105 Aufrufe • vor 1 Jahr
酷,浙大、vivo最新出的一款视频虚拟试衣模型:MagicTryOn,服装的时空一致性、稳定性、服装细节都保持的不错,效果可以直接用于电商广告了 支持图像试穿、视频试穿,以及自定义试穿 擅长在比如跳舞这种人体大幅度运动,和复杂场景中试穿 具备泛化能力,可以在玩偶上进行虚拟试衣 其用扩散Transformer取代U-Net架构,来提升模型的表达能力;结合全自注意力机制联合建模视频的时空一致性,确保试衣效果在时间和空间维度上自然流畅 #虚拟试穿 #MagicTryOn #tryon #AI穿衣

AIGCLINK
28,402 Aufrufe • vor 1 Jahr
兄弟盟,AI 女友真的要来了~ 刚在 GitHub 看到一个挺有意思的 AI 项目,叫 AIRI。 它想做的事情其实很简单:... show more

开发者Hailey
34,171 Aufrufe • vor 5 Monaten
用Seedance2.0生成了一个视频,文案如下: 帮我生成一个视频:请生成儿子与女儿在遇龙河富里桥下玩水的30秒视频。模型 2.0,比例 9:16,时长 10s。 然后一分钟后出来这样一个视频,这特么是AI????

迷人的小红
65,192 Aufrufe • vor 6 Monaten
阿里最新放出来了一款全新端到端角色图像动画框架:Wan-Animate-2,实时驱动角色,延迟极低 Wan-Animate-2的一大核心是实时交互,直接解锁直播主播、交互式数字人场景 首先,Teacher forcing+错误缓冲+Self-Forcing蒸馏+逐块反向传播三阶段训练,这套组合拳把延迟压到了实时,把从几分钟生成一段视频变成实时流式生成 其次是端到端不需要中间运动提取,之前的方法先提取骨骼/关键点再驱动,提取一错角色就崩 再就是驱动视频的拍摄角度和输出视角可以分开 以前驱动视频是从什么角度拍的,生成的视频就只能是什么角度,想让角色换个机位做不到,或者需要额外复杂的相机控制流程 现在直接打字就能改变输出视频的机位,动作和视角完全解耦 从效果上看,复杂动作、精细表情和物理合理性上复制的还可以,支持单人到多人、多人到多人、跨身份的动作迁移... show more

AIGCLINK
34,421 Aufrufe • vor 3 Tagen
seedance 2.5实在太贵了, 继续玩Grok,这个15秒视频是Grok一次生成,0抽卡, 目前视频大模型也就Grok能与之一战了吧🤔

AYi
43,081 Aufrufe • vor 11 Tagen
MiniMax H3 正式开源发布 目前最强开源视频生成模型! 分辨率最高支持 2K、时长最长 15 秒生成. H3-Base-FL2VA... show more

小娜学AI
15,202 Aufrufe • vor 10 Tagen
生成视频已经满足不了人类的欲望了,生成世界才是未来!地球Online的虚拟世界版要来了。。。 以前我们玩游戏都是一个固定好的世界,比如绝地求生、英雄联盟或者王者荣耀。。。但是我曾经还是畅想过在一个完全「未知」的世界升级打怪,不过从来没觉得这会变成现实,但是最近有一个词叫做「世界模型」非常火,我已经不止一次听说过它的名号。 世界模型的定义是:一种能够学习并模拟环境状态变化的 AI 模型。 它能根据过去的观察和当前动作,预测:当前状态+动作→下一个状态。例如:汽车当前速度、道路情况、方向盘操作→汽车下一秒的位置和周围环境。 ... show more

逸尘
20,391 Aufrufe • vor 24 Tagen