
鈴木憂一 | Highdrama
@yu_ichi_suzuki • 2,926 subscribers
AIアニメとオリジナル曲を生成。 Visuals: 生成AI / After Effects / Photoshop Music: SUNO → Ableton Live Creating independently. ヘッダー・アイコンは手描きです。 https://t.co/4AadBm4p5F
Shorts
Videos

ローカルMiniMax H3とCodex(GPT-6 Astra)を使ってピクセルパーフェクトなドット絵動画を作成しました。 作り方は、niji・journey → GPT Image 2.5でドット絵風に → ローカルMiniMax H3 → Codex(GPT-6 Astra)でピクセルパーフェクト化。 流れは以下のとおりです。 ① まずniji・journeyで元絵を作り、GPT Image 2.5でドット絵風に変換。 ② ComfyUI上のH3に同じ絵をファーストフレームとして渡し、カメラ固定・女性がその場で一回転・魚は別々の速度で泳ぐ、と指定して動画を生成。 ③ Codex(GPT-6 Astra)での作業に移り、生成した動画を344×192ドット・12fpsに。格子の位置と大きさは全フレームで固定。 ④ 全編共通の128色パレットで減色。ディザは使わず、前後3枚ずつの計7フレームを見て、ほぼ変わらない場所の小さな色揺れだけ抑える。 ⑤ 顔と手は基本色と影の2色を共通化。水の青緑を保ちながら主線を濃くし、他の色は明るく。さらに髪と傘の似た色を統合して、実色数111色へ。 ⑥ 最後に最近傍で3倍に拡大。1ドットが同色の3×3になっていることを、全フレームで検査してGIFにしました。 ピクセルパーフェクト化に使ったのは、Python+OpenCV/Pillow/NumPy/SciPyで組んだ独自の後処理です。OpenCVでAREA縮小、Pillowで共通パレットの減色とGIF出力、NumPy/SciPyで色の集計・近傍探索・時間安定化を行っています。 具体的なやり方は返信に置いたGitHubに記載しています。 人が打ったドットのようには中々キレイにならず、「機械的に縮小して減色したよね」という感じの絵になってしまいます。 やっぱり熟練した人のスキルはすごいですね。
鈴木憂一 | Highdrama56,623 次观看 • 18 天前

Seedance 2.5で一枚絵から四面図をつくり、Tripoを使ってポーズ付き3Dモデルを作りました。Nano(ナノ)さんのツイートを参考にしました。本当にすごいです。感謝です! これまでhi3dや3DGSパイプラインで挑戦しては挫折していましたが、ようやく3D化でそれっぽいものができました。 首と身体をくっつける際に多少いじっている程度で、基本的にはTripoのポン出し状態です。 自分なりの工夫としては四面図・キャラシートの作り方です。Nano BananaやChatGPT imagesでキャラシートを作ると角度ごとに微妙に細部が異なることが多いです。 そこで、Seedance 2.5に「被写体完全静止・カメラだけ等速で一周・超望遠で正射投影風」を指示して一枚絵の周りを回らせ、動画から前後左右を切り出す方式にしています Seedance 2.5はプロンプトの追従性が非常に良く、整合性を重視するため、こういう事が可能になります。 Blenderとても大事ですね、勉強します(ずっと言っている気がする……)。 Seedance 2.5用のプロンプトは次ポストに。
鈴木憂一 | Highdrama92,726 次观看 • 1 个月前

MiniMax H3で部屋を先に360°回して1本の動画にしておくと、AIアニメの背景がぶれにくくなくなる話。 AI生成アニメで困るのはカットが変わるたびに背景が別になってしまうことです。 キャラの一貫性は参照画像でだいぶ抑えられるようになりましたが、背景は毎回その場で描き直されて困ることが多いです。 対策として欲しい背景を「先に一貫性のある形でH3で撮影しておいて、あとから必要な壁だけ抜き出す」やり方が効きました。 今回は広角ぎみの一枚絵を開始フレームにして部屋を定点で360°回した動画を1本作り、それを部屋の唯一の正しい参照とします。 カメラ位置とカット点は、Blenderで箱と円柱だけの灰色クレイを作って動画で渡しました(クレイはClaude Codeに作らせています)。 そしてカットごとにカメラが向く壁の1フレームを切り出して参照画像にします。 オービット動画である必要はなくて、「後で切り出せる、矛盾のない背景の元」を作れればそれで構わなそうです。
鈴木憂一 | Highdrama44,712 次观看 • 25 天前

ローカルのMiniMax H3で、約9分で15秒の2K超え動画を生成する話(RTX 5090)。 Alibabaの蒸留LoRAで480pの当たりを引いて、同じlatentを1344×768に拡大して4ステップのrefine、最後にRTX Video Super Resolutionで2倍の2688×1536にアップスケール、という分担です。 RTX VSRは、拡散モデルのように描き直すのではなくフレームを1回通すだけなので、2688×1536へのアップスケールでも1フレーム0.1〜0.2秒くらいで済みます。 ただし、再生成ではないので元の絵がダメならダメなまま大きくなります。今回もrefineで絵を綺麗にしてから解像度を上げていますが、やはり2Kといっても寝ぼけた感じにはなってしまっています。 数値は今日の実測(362フレームで約85秒、モデル読み込み含む)を丸めたものです。 480p生成が約2分55秒、refineが約4分40秒、VSRが約1分25秒。 画質だけなら非蒸留の25ステップや、Alibabaの蒸留LoRAで最初から768pで回したほうがいいのかもしれないです。 ただ、480pなら1本3分弱で回して、当たりだけ、保存しておいたlatentでアップスケールすればいいので、こちらのほうが気楽に生成できます。
鈴木憂一 | Highdrama27,411 次观看 • 21 天前

MiniMax H3ローカルR2Vの高速化、手法が乱立していてどれがよいかわからなかったので色々生成してみました。 ・キャッシュ系(EasyCache/FBC)は音が痩せる ・EasyCache: ノイズが出て音も痩せるのでメリットなし ・FBC: 25stepsで速くなるがプロンプトでの動きの指示に反することがある ・turbo4: 絵が3Dっぽくなり影に階調が出る ・turbo8: 場面によっては実用可。ただし動きが激しいと精細さが落ちる ・SageAttentionもComfy Kitchenも25stepsでは素と同着(VRAM12-16GB帯では差が出るのではないかと思います) できるだけ綺麗にアニメ絵を動かしたい自分の場合、急ぎならturbo8(約2.7倍速)もありですが、結局キャッシュ無し25stepsが一番という元からの結論に。 測定条件: 同一プロンプト・同一シード・全構成ウォーム(直前に捨て生成1本)・ComfyUI内部タイムスタンプでms精度計時・RTX 5090/ComfyUI v0.33系/公式INT8構成。turbo = lightx2v公式のR2V専用turbo LoRA v0.1を4steps/8stepsで使用。 実運用ではモデルロード時間等が乗るので、ここまで綺麗な差にはなりません。アテンションを替えると同シードでも別テイクになるはずです。 全27構成の比較動画を置いておきます。
鈴木憂一 | Highdrama44,007 次观看 • 1 个月前

MiniMax H3のアリババLoRA(alibaba-paiのPDD 8-Step)をRTX 5090のComfyUIで試してみました。 これはすごいかも。 動画時間8秒,768p,i2vで同一シード・同一プロンプトの比較で 標準25step:398.7秒 アリババLoRA:145.8秒(63%減) もう少し試行したいとは思いますが、いまのところ自分の目では品質の差がわからなかったのでこちらに乗り換えを検討しています。 アリババLoRAで作った768pのlatentを2Kへアップスケールしても合計391.3秒で、標準25stepで768p1本作る時間で2K完成品が出る計算でした。 後半のモーショングラフィックスは480pで105.1秒→45.1秒(57%減)です。
鈴木憂一 | Highdrama28,885 次观看 • 1 个月前

MiniMax-Music3というローカル音楽生成モデルが出ましたので触ってみました(2026年8月時点、RTX 5090)。 プロンプトが薄いと音数の少ない出力になりがち。 公式デモのプロンプトもだいたい1曲に600〜800語使っています。 とても人の手で書く量ではない……と思ったら、公式GitHubにmusic-caption-rewriterというスキルが同梱されていました。短いプロンプトをLLMでこの書式に展開させましょう、ということなのかな。 自分はClaude Codeにこのスキルを読ませて書かせました。 語数少なめで出てくるミニマムなビートは自分は全然ありです。ただ、日本のメロディがしっかりしたポップスやロックが好きな人にはどうでしょう……。 Sunoの「エモいポップス」みたいな数語の指定でそこそこ聞けるものが出てくる、という感じではないです。 Sunoのどのモデルに似ているとも言い難く(あえて言うならv5.5)、どちらかというとACE-Step 1.5 XLに似てます。 Sunoのように全く関連性のないジャンルを無理やり併せてみる、みたいな使い方は難しそうです。 日本語の歌唱はかなりしっかりしています。動画生成のH3では漢字が中国語読みに引っ張られることがありましたが、Music3では今のところですが発音間違いは少ない印象。日英混じりの歌詞も歌い分けます。 一方で、ローカルの方にはSunoにあるCoverやExtendのような機能はありません。今のところ(2026年8月時点)テキストと歌詞から一発生成するだけ。 生成時間は、モデルロード後なら曲の実時間とだいたい同じくらい(60秒の曲が約50秒、2分半の歌ものが約3分)。 同じシードでも、秒数を変えると全く違う曲が出てきます。 添付は同じ歌詞・同じシードで、Sunoに書くようなプロンプトをそのまま入れた版(A)と、公式書式に展開した版(B)の聴き比べ。参考に(A)と同プロンプトを入れたSuno v4.5版(C)及びv5.5版(D)も入れています。 ただし、Suno版(C)(D)はAと同じプロンプトを使ってはいますが、Createを押すたびに(おそらくSeedが変わり)違う曲が出てきますので、公平な測定環境ではありません。
鈴木憂一 | Highdrama36,795 次观看 • 1 个月前

ローカルMiniMax H3は25 stepsを下限とすべき、というスレッドがredditにあったので、昨日のマルチショット(同一シード・同一プロンプト・参照3枚)で解像度とステップ数を変えて試してみました。 15は破綻した絵になり使えない。20でも全然いいのですが、床の映り込みやリファレンスの背景の色への忠実さでは確かに25以降がよかったです。 スレッドにはアニメでは32がいいと書いてあったけども、25と32の差は自分にはわからない……。 こういうのを見ると本番は25 stepsかなと。 「H3のAPI公式既定は50 stepsだ」みたいな話(真偽不明ですが)もスレッドでは出ています。 20 steps 生成時間775秒 / 25 steps 945秒 / 32steps 1225秒(1280×704・14秒・RTX 5090)
鈴木憂一 | Highdrama22,669 次观看 • 1 个月前
没有更多内容可加载