正在加载视频...
视频加载失败
字节发布了 Seedance 1.0 Pro 视频生成模型。就是即梦里面的视频3.0 pro 模型 提前测试了一下,发现这次字节的视频模型真的站起来了!! 在提示词理解、画面细节、物理表现一致性理解等方面都无可挑剔 通过火山引擎调用,5 秒 1080P 视频 API 价格仅为 3.67 元 下面有详细的测试👇
68,203 次观看 • 1 年前 •via X (Twitter)
16 条评论

01 多镜头生成测试 先来看看字节的看家本事吧,哈哈。 Seedance 1.0 Pro 这次单次生成多镜头的能力更加稳定和可用。 下面这个图生视频 Seedance 1.0 Pro 对于提示词的理解都非常到位。 三段完全不同景别和运镜的分镜都完美实现了。 而且由于是图生很考验场景和人物一致性,人物的装束和这种酒店的设计风格三个分镜都很一致没啥问题。

以往我们很少用文生,主要是视频生成成本高,崩坏概率大,文生不好控制。 但是随着像 Seedance 1.0 Pro 这样的提示词遵循非常好的模型不断出现,视频成本不断降低,文生在普通用户这里可能是主流。 下面这个一段提示词就搞定了一个餐饮宣传片的常见镜头,而且菜品的样式都能做到三个分镜是一样的。

注意看女生带着的耳机,在第二个分镜耳机的细节依然可以保持一致。 同时第三个分镜下手指打字这么精细的动作一点问题没有。

整个布景和物品都非常到位,符合古装剧的场景。 无论海外视频模型如何进步,在中国特色的文化内容上肯定是不行的,还是得指望 Seedance 1.0 Pro 这种国产模型。

02 图生视频测试 首先是藏师傅的老测试集,这个怪兽图你们应该见过很多次了。 但是每次出现,视频的质量依然可以看出非常明显的变化。 仔细看怪兽的毛发,光照在上面的质感非常真实,远处云雾也在缓慢的运动,下雨的时候他自己给补上了应该有的云层一点都不突兀。 可以说现在提示词遵循已经是最基本的要求了,更好的模型需要生成提示词中没说但是画面中应该有的内容。

第一次有模型把这张图和这个提示词完美的生成出来。 镜头确实是在向左环绕,而且镜头运动过程中周围的人物一直呈现运动模糊状态。 人物也在转身,在停下来的时候周围的人物变清晰,而且还是大幅度运动,表现出类似时停的感觉,所有的细节都这么完美。

这张图很难,因为整个的姿势是一个侧面而且周围还有这种非常规的水流,很考验模型的补全和想象能力。 可以看到 Seedance 1.0 Pro 非常顺滑的让人物完成了转身,而且头饰的细节非常优秀,以往的模型一般这种都会糊掉。

高风格化上的表现也非常亮眼,这种非常见风格写实和平面融合的很难搞。 Seedance 1.0 Pro 在风格上维持的相当完美,即使是大景别运动下依然保持了风格一致性。 而且手部握剑姿势没啥问题,剑身冒出的蓝光都是这个风格的。

03 文生视频测试 先来试试前几天在推上看到的一个 POV 运镜提示词,这个提示词非常考验运镜和提示词理解能力。 虽然受限于视频长度最后没有进入到胡同,但是已经看到入口了。 整个场景相当复杂,而且猫咪运动速度很快,但是从香料到喷泉到打瞌睡老人再到市场的其他人全都的细节都非常清晰,根本没有崩的迹象,相当稳定。 运镜的跟随也完成的很好,一直锁定着猫咪。

然后是另一快速运镜方式 FPV 无人机运镜。 非常精髓的鹿在镜头在从对着鹿身前再转到鹿生后的时候镜头的机动动作非常的无人机。 整个森林的植物细节和清晰度,真的太丰富了,而且可以长时间维持。

然后是一个既考验运动精细度,又考验物理特性,还考验中国文化理解的测试。 这里龙字没有写出来,当然让视频模型写出具体的中文几乎在现阶段是不可能的。 但是墨迹是否跟笔手部握笔姿势和写字姿势其实也很难做到很好。 当然 Seedance 1.0 Pro 都搞定了,握笔姿势和墨迹在纸上的晕染都无可挑剔,甚至每个笔画的笔记都能跟运笔姿势对上。

然后是考验物理特性和多人运动的场景,一般这种场景很容易出现肢体崩坏和穿帮。 但是 Seedance 1.0 Pro 就非常自然所有人的一致性都保持的很好,运动幅度很大的情况下物理碰撞也没问题。

测试到这里就结束了,整体来看 Seedance 1.0 Pro 在画质和稳定性上的表现是独一份的,而这两个也是用户最关注的部分,我这里的案例基本都没有抽卡。 另外生成是真的快,一个 1080P 原生的视频模型能有这么快的速度,只能说字节还是非常猛的,算法和卡都要下功夫才行。 在保证质量的前提下,影响模型推广的主要因素就是速度、稳定性、价格这三者,Seedance 1.0 Pro 都已经相较于其他模型迈出了一大步。

如何使用:

技术报告在这里:

Our speech-to-text models are the most accurate on the market with top rankings across industry benchmarks. - The highest accuracy rates—up to 95% - Up to 30% fewer hallucinations than other leaders - Low latency—63 minutes converts in 35 seconds Try via API for free today 👇
相关视频
Sensitive content
现在图生视频都在5秒或10秒,10秒的看上去像5秒的慢放,这个无论是在开源模型还是闭源模型上都有类似效果。尤其对于商业闭源视频来说,如果花费一倍以上的成本生成的10秒视频却只是5秒的慢放版,那就显得太不划算了。这里尝试一个方案:从商业闭源模型生成5秒视频,然后用插帧模型生成10秒视频,以下是使用Topaz插帧和原生的对比,供 这里尝试一个方案:从商业闭源模型生成5秒视频,然后用插帧模型生成10秒视频,以下是使用Topaz插帧和原生的对比,供大家参考。 #女s #les #女仆 #AI视频
獨自懵逼
18,922 次观看 • 1 年前
