LUTA@AI's banner
LUTA@AI's profile picture

LUTA@AI

@luta_ai8,921 subscribers

「面白い」を起点に、AIと共に映像・音楽・ゲーム・物語を制作|人間の“したい”を、誰かに届く価値へ変える実験の記録。

Shorts

Travisさんのプロンプトを参考に私も作ってみました😊巨人は中々作れなかったので嬉しい🥰 NanoBananaProプロンプト👇たまにCGになるけど! A highly detailed, photorealistic studious shot showing a colossal Japanese woman in glasses and a button-up shirt positioned lying on her stomach across several buildings. The giant is propped up on her elbows, holding a book between two buildings like a book stand, completely absorbed in reading. Her feet kick up behind her casually. To establish the immense scale, tiny office workers watching from windows, street level bookstores, and reading benches are visible. The lighting is overcast day with soft, even light perfect for reading. adobeのfireflyでNanoBananaProが今まだ0コスト!

Travisさんのプロンプトを参考に私も作ってみました😊巨人は中々作れなかったので嬉しい🥰 NanoBananaProプロンプト👇たまにCGになるけど! A highly detailed, photorealistic studious shot showing a colossal Japanese woman in glasses and a button-up shirt positioned lying on her stomach across several buildings. The giant is propped up on her elbows, holding a book between two buildings like a book stand, completely absorbed in reading. Her feet kick up behind her casually. To establish the immense scale, tiny office workers watching from windows, street level bookstores, and reading benches are visible. The lighting is overcast day with soft, even light perfect for reading. adobeのfireflyでNanoBananaProが今まだ0コスト!

53,395 次观看

✨lllyasviel氏が作成したFramePackをComfyUIを使いkijai氏のWrapperで試したところ、5秒動画が使用メモリ6GBで8分、12GBで6分ほどで生成できました😊 FramePackはHunyuanVideoをベースにした次フレーム予測モデルで、低リソースでも高品質な動画生成が可能 !これができるとなるとWan2.1でもできそうだしオープンソースも楽しくなってきた🥰 #AIVideo #FramePack

✨lllyasviel氏が作成したFramePackをComfyUIを使いkijai氏のWrapperで試したところ、5秒動画が使用メモリ6GBで8分、12GBで6分ほどで生成できました😊 FramePackはHunyuanVideoをベースにした次フレーム予測モデルで、低リソースでも高品質な動画生成が可能 !これができるとなるとWan2.1でもできそうだしオープンソースも楽しくなってきた🥰 #AIVideo #FramePack

67,802 次观看

✨WanVideo 2.2 Fun-Control 14B 実験 kijaiさんがwan2.2でコントロールネットが使えるワークフローを公開していたのでテスト DWposeを参照して、この子を自然に動かせました🎥 生成時間は77フレームで7分41秒ほど wan2.1より少し長い気もするがほぼ同等😊 I2vでLightX2Vはまだ出てないのでwan2.2で今i2vをするならこの方法がいいかも 📌 モデル: Wan2.2-Fun-Control 📌 制御: DWpose 📌 解像度: 720x1280 / 76f #AI #ComfyUI #Wan22

✨WanVideo 2.2 Fun-Control 14B 実験 kijaiさんがwan2.2でコントロールネットが使えるワークフローを公開していたのでテスト DWposeを参照して、この子を自然に動かせました🎥 生成時間は77フレームで7分41秒ほど wan2.1より少し長い気もするがほぼ同等😊 I2vでLightX2Vはまだ出てないのでwan2.2で今i2vをするならこの方法がいいかも 📌 モデル: Wan2.2-Fun-Control 📌 制御: DWpose 📌 解像度: 720x1280 / 76f #AI #ComfyUI #Wan22

43,714 次观看

🚀ついにローカル環境で高精度リップシンクが実現! 静止画から自然な口の動きを生成できるようになりました✨ WanVideoWrapperのmultitalk機能がmainブランチにマージされたので検証してみた結果: 📊検証結果: * 音声:ElevenLabs v3使用 * 精度:短時間(5秒以下)では非常に高品質 * 制限:10秒以上では画質・リップ精度が低下(いい設定見つけたら教えて🙏) * 環境:WSL新環境で生成(既存環境では上手く行かず…) 💡実用的な発見: ローカルでこの品質のリップシンクができるのは画期的。クラウド依存から解放されて嬉しい。 ⚠️注意点:既存のComfyUI環境では全く改善できなかったので、WSLを入れて新しい環境を作って生成しました。WSLの構築は簡単ですが、comfuiやらmultitalkがかなりややこしく、やり直しをかなりしたため環境構築に丸1日かかりました。もしやる場合は時間に余裕がある時が良いかと思います💦 👇リプにWanVideoWrapperのリンク #ComfyUI #AIアート #リップシンク #オープンソース #WanVideoWrapper

🚀ついにローカル環境で高精度リップシンクが実現! 静止画から自然な口の動きを生成できるようになりました✨ WanVideoWrapperのmultitalk機能がmainブランチにマージされたので検証してみた結果: 📊検証結果: * 音声:ElevenLabs v3使用 * 精度:短時間(5秒以下)では非常に高品質 * 制限:10秒以上では画質・リップ精度が低下(いい設定見つけたら教えて🙏) * 環境:WSL新環境で生成(既存環境では上手く行かず…) 💡実用的な発見: ローカルでこの品質のリップシンクができるのは画期的。クラウド依存から解放されて嬉しい。 ⚠️注意点:既存のComfyUI環境では全く改善できなかったので、WSLを入れて新しい環境を作って生成しました。WSLの構築は簡単ですが、comfuiやらmultitalkがかなりややこしく、やり直しをかなりしたため環境構築に丸1日かかりました。もしやる場合は時間に余裕がある時が良いかと思います💦 👇リプにWanVideoWrapperのリンク #ComfyUI #AIアート #リップシンク #オープンソース #WanVideoWrapper

40,562 次观看

✨依存関係の地獄をuvで突破。LTX-2.3、ComfyUIで無事着弾! LTX-2.3が来たので早速導入。まずは公式ワークフローから。 以前アドバイスいただいたuv構築環境のおかげで、依存関係の地獄を踏まずに一発完走できました!感謝。 モデル総量50GB超えのヘビー級だけど、RTX 4090+オフロードでもしっかり生成。 現状1280x720/121フレームで9分弱(541.07 seconds) 見た通りノイズや質感の課題はあるけど、自動で音声付き動画がフルスペックで動作することが確認できました。ここから最適化の旅が始まるなー😊楽しみ。 #LTX23 #ComfyUI #AI動画生成 #uv

✨依存関係の地獄をuvで突破。LTX-2.3、ComfyUIで無事着弾! LTX-2.3が来たので早速導入。まずは公式ワークフローから。 以前アドバイスいただいたuv構築環境のおかげで、依存関係の地獄を踏まずに一発完走できました!感謝。 モデル総量50GB超えのヘビー級だけど、RTX 4090+オフロードでもしっかり生成。 現状1280x720/121フレームで9分弱(541.07 seconds) 見た通りノイズや質感の課題はあるけど、自動で音声付き動画がフルスペックで動作することが確認できました。ここから最適化の旅が始まるなー😊楽しみ。 #LTX23 #ComfyUI #AI動画生成 #uv

18,656 次观看

Videos

luta_ai's profile picture

✨MiniMax H3、RTX 4090(24GB)で15秒の音声付き動画が丸ごと生成できた!🎉 しかも学習範囲の上限(362フレーム=15.08秒)まで到達。9.6分。 でも最初は5秒生成に496秒かかってました。設定3つで別物になった💦 ・torchは cu130 必須。cu128だと comfy_kitchen のCUDAバックエンドがavailable:True なのに disabled:True になって、int8演算が全部eager落ち → サンプリング 6.12 → 1.92 s/it(3.19倍) ※ただし nvfp4 は cu130 でもエミュレーションのまま。4090(Ada)にFP4のTensorCoreが無いので💦 速くなったのはint8側の寄与です ・--fast-disk は付けちゃダメぽい。モデルをNVMeに置くのは良かったみたいだけど"退避先"までディスクにするフラグなので往復が発生する → 5秒尺の合計 496秒 → 118秒 ※ここはRAM次第かも。うちはRAM 32GBで19GB空けられたので退避先がRAMで足りました。空きが少ないと逆にディスクの方が良くなる可能性あり ・--vram-headroom 2 が効く。WindowsはVRAM溢れてもOOMにならず共有メモリ(システムRAM)に静かに落ちるだけなので気づけない → 8秒尺のデコード 603秒 → 33.9秒 エラーが一度も出ないまま10倍以上遅くなってたので、 もし引っかかる人がいたらこのあたりをLLMに見てみるといいかも😊 #ai #comfyui

LUTA@AI

103,508 次观看 • 1 个月前

luta_ai's profile picture

✨MiniMax H3の4ステップLoRA、Xで見かけたので試してみました! 1280x736・14秒が 15分57秒 → 4分3秒 になりました(3.9倍) 同じシード・同じ参照画像・同じプロンプトでの比較です。 使ったのはlightx2vの蒸留LoRAを、KijaiさんがComfyUI用に変換してくれているもので、少し深めに調査してみました😊 ファイル名がFL2V用になってたけど、Ref2VA(参照から動画)に挿してみたら普通に動きました🤔 絵は20ステップ版と並べてみて、明らかに落ちる感じはしなかったです。細部もそんなに変わらない。 ただ4ステップの方が動きが小さめでした🤔 3本回しても同じだったので、シードではなくステップ数の影響だと思います。少ないステップで決めきる必要があるぶん、無難な方に寄るんじゃないかなと とはいえ20ステップの方は動きが激しいぶんキャラが反転したりしていたので、どっちが良いとも言い切れないです あと生成速度は5倍にはなりませんでした💦 ステップは20→4で1/5になるんですが、VAEデコードとmp4書き出しの時間は変わらないので、そこが全体の4分の1くらいを占めます。どれだけステップを減らしてもこの1分弱は残るので、頭打ちがあるぽいです そして前にSageとEasyCacheは同時に使えて速さも重なると書きましたが、EasyCacheとこのLoRAは重なりませんでした🤔 ログを見ると1ステップも飛ばしてなくて、監視の分だけ5〜6%遅くなるだけでした。同じシードで比べたら絵も音も完全に同じです 理由は「何を削っているか」が同じだからだと思います。EasyCacheは前のステップと似ていたら計算を省く仕組みなんですが、4ステップだと1歩の変化が大きすぎて似ていない。ステップ間の余りをLoRAが先に全部使ってしまった感じです Sageは計算のやり方を変える手法なのでステップ数と関係なく、こちらは重なります なのでEasyCacheが悪いわけではなくて、20ステップなら普通に効きます(前に測った時は5/20飛ばして1.34倍でした)。今回のは4ステップの話です あと前回「15秒だけ通らない」と書いた件、4ステップでも同じところで落ちました。ステップ数ではなく1回の計算に渡る量で決まっているみたいです なので15秒の中で激しいカット割りをやりたい時は、今はまだこのLoRAじゃないかもしれません。作者さんもv0.1のプレビュー版で「改良版を開発中」と書いているので、そこは待ちかなと思っています とはいえ4分なら試せる回数が全然違うので、しばらくこれで回してみます😊 リプにリンクと導入手順👇 #ai #comfyui

LUTA@AI

40,722 次观看 • 1 个月前

luta_ai's profile picture

sora2を今日の分100回分回しました。 やる前とやった後では印象が違いました🤔 これは知り合いと送り合って遊ぶこれまでの動画生成AIの導線とは全く違う導線なのかも。 そう思うとめっちゃ興味深かった。 特にこのカメオ機能。これで自分を撮ったり友達を撮ってきてお互いに変なことしたりして送り合って、リミックスして面白がるみたいな。身内で楽しむノリ😊 知らない人が見てもまったく面白くないけど、知ってたら面白いみたいな。だから今までのSNSとはちょっと違う印象だった。 そう考えると10秒間しか作れないのも納得感がある。発想だけで面白いもの作るAIならではのアプリ。そう考えると興味深い😊 招待が解放されたらパブリックで楽しむのもあるかもだけど、それよりクローズドな関係で楽しむ感じがした。 スマホで手軽に動画生成を使った新しい遊びという感じだから、AIを使った次世代のプロダクトをリリースしたんじゃないかなと感じている。 それにそもそも、ダウンロードは透かしが入るので、そっちはおまけ。スマホだと透かしが入ってないので、普通に見える。スマホ前提の新しいAIプロダクトとみると、新しさを感じる。 とはいえ、評価するのは市場だから、全体解放された時に市場がどういう捉え方をしていくのか、どう判断するかが楽しみ🤔 新しいって難しい… #Sora2

LUTA@AI

306,924 次观看 • 11 个月前

luta_ai's profile picture

Qwen3.8-27Bがでたのでシューティングゲームを作ってもらったのだけど、Claudeの作業ルールを読んで実装していて驚いた😊 4090一枚でQwen3.8-27B(Q4量子化)をllama.cppで動かして、opencodeから指示。全部ローカルで完結してるのでAPI代はもちろんゼロです。 ここまではまあ想定通りだったわけですが、ゲームを作る手順がかなり効率的だった🤔 自分がClaude用に書いてた作業ルール(CLAUDE.md)を、opencodeが勝手に読んでくれてた。 そこに「作業を始める時はまず知見ファイルを読め」と書いてあるので、Qwenがその通りに読みに行く。 さらに面白いのがここで、その知見ファイルは索引になっていて「ゲームを作る時はこれ、動画の時はこれ」と分岐が並んでる。 Qwenは索引を読んで、ゲーム制作用のファイルだけを自分で選んで開いてました。全部読むでも読まないでもなく、今回必要な分だけ。 これは指示してません。索引を渡しただけです。 で、出てきたコードに実際その知見が入ってた。HUDの更新を1箇所にまとめる書き方とか、数値を設定ファイルに集約するとか、前に自分がハマって書き残したやつ。 数字にするとこう。 ・最初の指示から最後のファイルまで15分 ・13ファイル/583行 ・生成速度38.2 tok/s(1回の返答で約15,000トークン書いてる) ・コンソールエラー0 ・タイトル→自機移動→弾→敵→当たり判定→スコア→ウェーブ進行まで動く ゲーム自体は素朴です。この前Grokに作ってもらったやつと比べるとコード量で1/5くらいだし、1回の返答で15,000トークン使うので64Kのコンテキストは4〜5往復で埋まる。作り込んでいく用途には向いてない。 それでも使い方は広がりそう。 なにより、自分が積んできた知見が別の道具でもそのまま使えるのはいいね。移植作業は一切せずにこれができるのは楽だ😊

LUTA@AI

15,127 次观看 • 24 天前

luta_ai's profile picture

✨AI音声で一貫した声を作り会話させるチャレンジ 前に音声を使ってLLMの文章を読ませることには成功していたけど、今回はオリジナルの声を作成してみました。 やったこと: ①まずQwen3-TTSで声を1個作る ②その声で171個量産(台詞バリエーション) ③Style-Bert-VITS2で学習 → 50分でカスタム音声モデル完成 ④UIに接続 → リアルタイムで喋る やばい!自分で作った声だと楽しい😊 苦労したところ: ・最初はブラウザ内TTS(Chatterbox)を試した → 1文30秒&英語のみでまだ難しいしそもそもこの用途が厳しいかも💦 ・SBV2に切り替えたら環境構築に手間取ったけどうまくいった ・ただライセンスは要注意。やる場合は先にライセンス確認を。用途によっては制限があるものもある📝 まだまだ色々あるけど、今後のことを考えるとNVIDIAからも良い音声AIが出てるし、対応できるようにしておきたい。 今回は前回と同じくモデルはGPT-OSS 20Bだけど、Ollamaから読んでるので早い。 WebGPUでこれぐらい出たら嬉しいけどなー🥰 とはいえローカルでここまでできるようになったのは嬉しい。データは一切外に出ないしね。 声の元はAI生成だから、「存在しない人の声」をAIが学習して、AIキャラが喋る。 #AI #TTS

LUTA@AI

57,505 次观看 • 6 个月前