Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

一个模型搞定视频+音频+口型! 你看到的这个就是 LTX 刚刚发布的 LTX-2 开放权重大模型, 这个模型可以文生视频或者图生视频, 这个模型最大的特点是在保证了画质和一致性的同时, 可以生成音频! 而且音频和口型完全适配! 并且说话人神态也非常棒! 模型大小是 19B, 相当可用! 演示视频是我用 HuggingFace Zero GPU 生成的 demo, 10秒视频大概需要5分钟左右生成时间. 我测试目前来看最大的优点就是口型和声音生成得非常好, 并且一致性很高. 指定人物使用什么样的银色就能稳定生成. 当然模型也有不足之处, 主要是还是偶尔能看到模型生成人物皮肤的那种油腻感. 当然官方的 pro 版本在这点上处理的更好, 并且 pro 版本支持4K分辨率输出, 当然 pro 版本是没有开源的.

19,836 görüntüleme • 8 ay önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

惊艳!这个真的太有用了!!! 做过视频的人才知道!这个有多么刚需!! 各种生成式模型发展到现在,其实一直有一个痛点没有很好的解决! 即便是最强大的Seedance2.5模型,能够带来稳定的画面表现, 但是要想得到比较好的画面音效,可能并不容易, 更糟心的是,如果生成一条视频,画面很棒但音效有瑕疵! 除了大量抽卡,或者靠后期优化,基本没有其他办法! 万万没想到,Pika居然针对视频音效出了新模型!这需求洞察力真是绝了! 这次 Pika 一口气发布了 4 款 Audio Models,主打 least expensive,生成更快,成本更低,我对比了一下,常见声音模型里,价格几乎最低! 我觉得最实用、也最好玩的就是Video-to-audio,上传一段视频,它会根据画面内容自动生成(或补全)相匹配的环境音、音效、音乐甚至是人物配音。 下面这个视频就是一段30秒的无声视频,然后用Pika Soundtrack 直接生成的音效音轨,我特意用了一段声音要求比较复杂的画面,不光要壁炉的柴火声,还要小猫的叫声和呼噜声,以及窗外的雨声,更重要的还要表现出声音之间的层次和空间关系,最后的成片真的完成度很高!! 如果几个模型搭配着用,还能一次搞定BGM+音效+旁白。 这简直让AI生成内容的可控性上升了好几个level!

沐阳

20,131 görüntüleme • 1 ay önce