正在加载视频...

视频加载失败

流行のJevをMiniMax H3に組み込んで、動画生成を高速化してみた!Attention処理のスパース化にJevを使用。 ・層ごとにJevが重要度を判定(4step 49層が対象) ・Jevがスパース率1%, 3%, 5%, 10%を選択 RTX4070で6分7秒→3分34秒で41.7%短縮!動画生成中にJevクラウドに問合せしているのに速い!

500,903 次观看 • 2 天前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

これはヤバい AI動画の作り方が完全に変わった GPT-6でプロンプトを作る それをMiniMax H3に投げるだけ 15秒のファッションMVまで一気に作れる 動画を見ると完成度の意味がわかる 再現方法は👇 まずGPT-6に作りたい映像を伝える 今回はファッション系のMV 人物を中心に置いて 衣装が次々と切り替わる構成にする 重要なのは動画を直接作らせないこと 先にGPT-6でプロンプトを設計する 映像の構図 人物の動き 衣装の変化 カメラワーク 背景 テンポ 全体の世界観 これらを文章にまとめてもらう そのプロンプトをMiniMax H3に投入 するとH3側が映像として生成する 今回の動画では 同じ人物を軸にしながら 衣装だけが自然に切り替わっていく 単なる画像の切り替えではない 人物の動きと衣装変化がつながっている だからファッションMVとして見せられる 16:9の横動画で 約15秒のルックブックまで作れる これを人間が作るなら 企画を考えて モデルを用意して 衣装を何着も準備して 撮影して カットをつないで トランジションを作る必要がある でもAIなら 「プロンプト設計→生成」まで一気に短縮できる 一番重要なのはここ 動画AIだけ触るより GPT-6を“演出家”として先に使う方が強い 何を映すかをGPT-6で詰めて どう動かすかをH3に任せる この役割分担で完成度が一段上がる 商品PV アパレル広告 SNS用MV ブランドのルックブックにも使える これからは動画編集スキルだけじゃない AIに映像を設計させる力で差がつく

鈴木@アナログ営業会社を100日後にAIで売上を300%にする人

87,478 次观看 • 14 天前

ローカルのMiniMax H3のR2Vで、8秒間の1080p級(アップスケール)の動画を8分弱で生成する方法を詰めてみました。 RTX 5090で8秒・1920×1056の動画を480p生成160秒+アップスケール310秒の合計7分50秒でできました。 ByteDanceのアップスケーラもかなり良いのですが、階調がおかしくなったり、変なトランジションが入ることがあります。 今回のlatent Upscalerによるものは元々の動画生成の際のlatentの段階で拡大しているので、仕組みが違うようです。 元のワークフローだと、拡大後のrefineが生成と同じ25stepsで回るようだったので、そこだけR2V用の蒸留LoRA(minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16)に変えました。4stepsと8stepsで試しましたが、秒数の違い(250秒くらい違う)の割に差が自分にはわかりませんでした。 蒸留LoRA 4stepsは「一から絵を描かせるのはキツいけど、細部を修正するくらいなら全然できる」という感じです。 もうひとつ大切なのは、アップスケールの時のconditioningを生成時と同じものに付け直すのが効いたという点です。 標準だと480p用の条件を引き伸ばして使うそうで劣化しているらしいです(Claude Codeが言うには)。 そこで同じ参照を目標解像度で付け直すと、ちゃんとリファレンスどおりになります。 例えば、今回の動画ですと、眉毛のところの描写がキャラクターのリファレンス通りになっています。1枚目の比較画像で分かると思います。 ちなみにSeedance 2.5のオムニリファレンスだと、8秒間の動画をリファレンス8枚付きで生成しようとすると936クレジットでした。スタンダードプラン5,200円で5,775クレジットなので、1本あたり約843円という計算になります。 ローカルのH3はさすがにSeedance 2.5と同レベルとは言えませんし、Seedanceが絶対に必要な場面は存在していますが、とはいえ高解像度のものがローカルで手軽に出せるのはいいですね。

鈴木憂一 | Highdrama

11,982 次观看 • 1 个月前