Loading video...
Video Failed to Load
#国外爆火emo模型国内上线了 阿里可以让人像照片变成唱歌视频的项目 EMO 终于发布了,体验了一下非常强。 一张简单的照片加上克隆的语音模型,字节就可以定制自己的数字人出镜。 Heygen 之类的产品都需要录制一段相当长的视频,并且算力成本也很高,这个直接是免费的。 明天开放公测,想要提前体验的同学可以在后面的推用我的内测邀请码。 而且不局限于写实的人像,3D 模型、 二次元漫画都可以生成视频,生成一张自己喜欢的二次元图片然后加上自己的克隆语音就可以当Vtuber了。 EMO效果为什么这么自然: 通过阅读EMO的论文发现,他们在talking head领域首次提出了weak condition(弱控制)的设计,即剔除掉了任何针对人脸的显示表征建模,转而采用一些相对较弱的控制条件来引导diffusion去噪过程,这一点其实灵感来源于文生图模型中,采用粗粒度的prompt描述来生成图片。 他们在算法pipeline中加入了face locator和speed layers,分别用来控制人脸的生成区域(人头摆动幅度)与人头的动作频率。通过这些操作,可以最大化地保留diffusion模型强大的生成创造能力,由于没有针对表情的显示表征的限制,所生成的人脸表情都会有较高的丰富度,从而表现力有较大的提升 EMO没有针对人脸生成做过多的控制,人物会做什么表情,头部会如何运动,都是由模型从数据中学习到相关的知识决定。 表情、口型的一致如何保证: 模型会在训练中找到音频特征与图像中像素的对应关系,从而放大音频特征对于这些相关像素的影响,比如嘴部,眉眼等位置的像素,让图像中的人物表情口型与音频特征保持一致。 EMO在250小时的人物讲话视频上训练,不仅仅找到了audio中具体发音与人像口型的匹配关系,更重要是发现了音频中的语气特征与人物表情的关联性,从而将音频中的语气特征,甚至暗含的情绪色彩反映到了人物微表情上,它模型在训练中慢慢学习并编码了人类表达情绪的能力。
51,712 views • 2 years ago •via X (Twitter)
11 Comments

歸藏(guizang.ai)2 years ago
可以用我的口令“归藏”申请内测资格,申请链接:

歸藏(guizang.ai)2 years ago
2.5D 人像测试

歸藏(guizang.ai)2 years ago
真实人像侧脸测试:

UserInterface4 years ago
Need Professional Video Production, Music Videos, Commercials, Graphic Design, or Photo Retouching? We will take your project from concept to completion. #services #creative #DMV

huanggou2 years ago
排队生成中,预计19点51分完成,麻了😅

歸藏(guizang.ai)2 years ago
人太多了

今浣不睡覺2 years ago
我也想玩玩,還有機會嗎

HisenHou2 years ago
很棒

斜阳记事2 years ago
这个嘴巴牙齿有时候好吓人啊

guge2 years ago
哈哈 腾讯开源了,阿里跟进节奏吗

guge2 years ago
内测太火爆啦,感谢大家的支持,内测挤爆了,目前已上全量,大家直接使用就好了。 不用登记,直接下载通义App就可以使用。
