鈴木憂一 | Highdrama's banner
鈴木憂一 | Highdrama's profile picture

鈴木憂一 | Highdrama

@yu_ichi_suzuki • 2,926 subscribers

AIアニメとオリジナル曲を生成。 Visuals: 生成AI / After Effects / Photoshop Music: SUNO → Ableton Live Creating independently. ヘッダー・アイコンは手描きです。 https://t.co/4AadBm4p5F

Shorts

ローカルMiniMax H3の当たり探し、「予告編」方式が良い感じかも。 20step設定のまま最初の5stepだけ実行して途中経過を書き出す(左・約80秒)。ボケてるけど構図や月の大きさは確認できる。気に入ったシードだけ完走(右・約190秒)すると、予告編と同じテイクがそのまま仕上がる。 サンプラーが決定論的なので、同じシード・同じ設定なら途中まで走っても完走しても同じ経路になる、ということらしいです。 蒸留LoRAの下見だと、本番で細部は違う動画になってしまうので、「選んだ構図がそのまま完成する」こちらの方が自分には合ってるかも。 このシーンだと月の大きさとか柱の位置などはかなり気になり、リテイクも多くなりそうなので。 環境: RTX 5090 / ComfyUI / R2V 864×480・14.4秒 / res_multistep 20step+FirstBlockCache

ローカルMiniMax H3の当たり探し、「予告編」方式が良い感じかも。 20step設定のまま最初の5stepだけ実行して途中経過を書き出す(左・約80秒)。ボケてるけど構図や月の大きさは確認できる。気に入ったシードだけ完走(右・約190秒)すると、予告編と同じテイクがそのまま仕上がる。 サンプラーが決定論的なので、同じシード・同じ設定なら途中まで走っても完走しても同じ経路になる、ということらしいです。 蒸留LoRAの下見だと、本番で細部は違う動画になってしまうので、「選んだ構図がそのまま完成する」こちらの方が自分には合ってるかも。 このシーンだと月の大きさとか柱の位置などはかなり気になり、リテイクも多くなりそうなので。 環境: RTX 5090 / ComfyUI / R2V 864×480・14.4秒 / res_multistep 20step+FirstBlockCache

110,732 Aufrufe

MiniMax H3をComfyUIでローカル生成して、Seedance 2.5と比較してみました(RTX 5090)。 同じ開始画像・同じプロンプトで、480p縦・5秒・日本語台詞つきのi2v。 ローカル側の生成時間は約1分半でした。

MiniMax H3をComfyUIでローカル生成して、Seedance 2.5と比較してみました(RTX 5090)。 同じ開始画像・同じプロンプトで、480p縦・5秒・日本語台詞つきのi2v。 ローカル側の生成時間は約1分半でした。

23,567 Aufrufe

7人同時にそれぞれ別の振り付けで踊らせる、というのをMiniMax H3(ローカル、RTX 5090)とSeedance 2.5で比較してみました。 同じ開始画像・同じプロンプトで、5秒・BGMも生成込み。ローカル側の生成時間は約5分でした。 ローカルH3も頑張ってはいる感じ。改めてSeedanceが謎の技術に感じられる。

7人同時にそれぞれ別の振り付けで踊らせる、というのをMiniMax H3(ローカル、RTX 5090)とSeedance 2.5で比較してみました。 同じ開始画像・同じプロンプトで、5秒・BGMも生成込み。ローカル側の生成時間は約5分でした。 ローカルH3も頑張ってはいる感じ。改めてSeedanceが謎の技術に感じられる。

21,111 Aufrufe

ローカルのMiniMax H3のR2Vで、8秒間の1080p級(アップスケール)の動画を8分弱で生成する方法を詰めてみました。 RTX 5090で8秒・1920×1056の動画を480p生成160秒+アップスケール310秒の合計7分50秒でできました。 ByteDanceのアップスケーラもかなり良いのですが、階調がおかしくなったり、変なトランジションが入ることがあります。 今回のlatent Upscalerによるものは元々の動画生成の際のlatentの段階で拡大しているので、仕組みが違うようです。 元のワークフローだと、拡大後のrefineが生成と同じ25stepsで回るようだったので、そこだけR2V用の蒸留LoRA(minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16)に変えました。4stepsと8stepsで試しましたが、秒数の違い(250秒くらい違う)の割に差が自分にはわかりませんでした。 蒸留LoRA 4stepsは「一から絵を描かせるのはキツいけど、細部を修正するくらいなら全然できる」という感じです。 もうひとつ大切なのは、アップスケールの時のconditioningを生成時と同じものに付け直すのが効いたという点です。 標準だと480p用の条件を引き伸ばして使うそうで劣化しているらしいです(Claude Codeが言うには)。 そこで同じ参照を目標解像度で付け直すと、ちゃんとリファレンスどおりになります。 例えば、今回の動画ですと、眉毛のところの描写がキャラクターのリファレンス通りになっています。1枚目の比較画像で分かると思います。 ちなみにSeedance 2.5のオムニリファレンスだと、8秒間の動画をリファレンス8枚付きで生成しようとすると936クレジットでした。スタンダードプラン5,200円で5,775クレジットなので、1本あたり約843円という計算になります。 ローカルのH3はさすがにSeedance 2.5と同レベルとは言えませんし、Seedanceが絶対に必要な場面は存在していますが、とはいえ高解像度のものがローカルで手軽に出せるのはいいですね。

ローカルのMiniMax H3のR2Vで、8秒間の1080p級(アップスケール)の動画を8分弱で生成する方法を詰めてみました。 RTX 5090で8秒・1920×1056の動画を480p生成160秒+アップスケール310秒の合計7分50秒でできました。 ByteDanceのアップスケーラもかなり良いのですが、階調がおかしくなったり、変なトランジションが入ることがあります。 今回のlatent Upscalerによるものは元々の動画生成の際のlatentの段階で拡大しているので、仕組みが違うようです。 元のワークフローだと、拡大後のrefineが生成と同じ25stepsで回るようだったので、そこだけR2V用の蒸留LoRA(minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16)に変えました。4stepsと8stepsで試しましたが、秒数の違い(250秒くらい違う)の割に差が自分にはわかりませんでした。 蒸留LoRA 4stepsは「一から絵を描かせるのはキツいけど、細部を修正するくらいなら全然できる」という感じです。 もうひとつ大切なのは、アップスケールの時のconditioningを生成時と同じものに付け直すのが効いたという点です。 標準だと480p用の条件を引き伸ばして使うそうで劣化しているらしいです(Claude Codeが言うには)。 そこで同じ参照を目標解像度で付け直すと、ちゃんとリファレンスどおりになります。 例えば、今回の動画ですと、眉毛のところの描写がキャラクターのリファレンス通りになっています。1枚目の比較画像で分かると思います。 ちなみにSeedance 2.5のオムニリファレンスだと、8秒間の動画をリファレンス8枚付きで生成しようとすると936クレジットでした。スタンダードプラン5,200円で5,775クレジットなので、1本あたり約843円という計算になります。 ローカルのH3はさすがにSeedance 2.5と同レベルとは言えませんし、Seedanceが絶対に必要な場面は存在していますが、とはいえ高解像度のものがローカルで手軽に出せるのはいいですね。

12,169 Aufrufe

Videos

yu_ichi_suzuki's profile picture

ローカルMiniMax H3とCodex(GPT-6 Astra)を使ってピクセルパーフェクトなドット絵動画を作成しました。 作り方は、niji・journey → GPT Image 2.5でドット絵風に → ローカルMiniMax H3 → Codex(GPT-6 Astra)でピクセルパーフェクト化。 流れは以下のとおりです。 ① まずniji・journeyで元絵を作り、GPT Image 2.5でドット絵風に変換。 ② ComfyUI上のH3に同じ絵をファーストフレームとして渡し、カメラ固定・女性がその場で一回転・魚は別々の速度で泳ぐ、と指定して動画を生成。 ③ Codex(GPT-6 Astra)での作業に移り、生成した動画を344×192ドット・12fpsに。格子の位置と大きさは全フレームで固定。 ④ 全編共通の128色パレットで減色。ディザは使わず、前後3枚ずつの計7フレームを見て、ほぼ変わらない場所の小さな色揺れだけ抑える。 ⑤ 顔と手は基本色と影の2色を共通化。水の青緑を保ちながら主線を濃くし、他の色は明るく。さらに髪と傘の似た色を統合して、実色数111色へ。 ⑥ 最後に最近傍で3倍に拡大。1ドットが同色の3×3になっていることを、全フレームで検査してGIFにしました。 ピクセルパーフェクト化に使ったのは、Python+OpenCV/Pillow/NumPy/SciPyで組んだ独自の後処理です。OpenCVでAREA縮小、Pillowで共通パレットの減色とGIF出力、NumPy/SciPyで色の集計・近傍探索・時間安定化を行っています。 具体的なやり方は返信に置いたGitHubに記載しています。 人が打ったドットのようには中々キレイにならず、「機械的に縮小して減色したよね」という感じの絵になってしまいます。 やっぱり熟練した人のスキルはすごいですね。

鈴木憂一 | Highdrama

56,623 Aufrufe • vor 18 Tagen

yu_ichi_suzuki's profile picture

MiniMax-Music3というローカル音楽生成モデルが出ましたので触ってみました(2026年8月時点、RTX 5090)。 プロンプトが薄いと音数の少ない出力になりがち。 公式デモのプロンプトもだいたい1曲に600〜800語使っています。 とても人の手で書く量ではない……と思ったら、公式GitHubにmusic-caption-rewriterというスキルが同梱されていました。短いプロンプトをLLMでこの書式に展開させましょう、ということなのかな。 自分はClaude Codeにこのスキルを読ませて書かせました。 語数少なめで出てくるミニマムなビートは自分は全然ありです。ただ、日本のメロディがしっかりしたポップスやロックが好きな人にはどうでしょう……。 Sunoの「エモいポップス」みたいな数語の指定でそこそこ聞けるものが出てくる、という感じではないです。 Sunoのどのモデルに似ているとも言い難く(あえて言うならv5.5)、どちらかというとACE-Step 1.5 XLに似てます。 Sunoのように全く関連性のないジャンルを無理やり併せてみる、みたいな使い方は難しそうです。 日本語の歌唱はかなりしっかりしています。動画生成のH3では漢字が中国語読みに引っ張られることがありましたが、Music3では今のところですが発音間違いは少ない印象。日英混じりの歌詞も歌い分けます。 一方で、ローカルの方にはSunoにあるCoverやExtendのような機能はありません。今のところ(2026年8月時点)テキストと歌詞から一発生成するだけ。 生成時間は、モデルロード後なら曲の実時間とだいたい同じくらい(60秒の曲が約50秒、2分半の歌ものが約3分)。 同じシードでも、秒数を変えると全く違う曲が出てきます。 添付は同じ歌詞・同じシードで、Sunoに書くようなプロンプトをそのまま入れた版(A)と、公式書式に展開した版(B)の聴き比べ。参考に(A)と同プロンプトを入れたSuno v4.5版(C)及びv5.5版(D)も入れています。 ただし、Suno版(C)(D)はAと同じプロンプトを使ってはいますが、Createを押すたびに(おそらくSeedが変わり)違う曲が出てきますので、公平な測定環境ではありません。

鈴木憂一 | Highdrama

36,795 Aufrufe • vor 1 Monat

Keine weiteren Inhalte verfügbar