正在加载视频...

视频加载失败

好きな人の声で好きな文章を読ませるMicrosoftの音声AI「SpeechX」、映像から3Dシーンを生成するNVIDIA開発「Neuralangelo」のコード公開など重要論文5本を解説(生成AIウィークリー) 添付動画は安定したビデオ合成ができる動画処理技術「CoDeF」の出力結果。

98,071 次观看 • 3 年前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

【速報】中国Alibabaがマルチモーダルで勝負を仕掛けてきた。テキスト・画像・音声・動画を全て理解して音声も生成できる「Qwen3-Omni」を完全オープンソース化。何が凄いのか、具体的に解説していきます。 ①音声生成できる唯一のオープンソースモデル MetaのLlama 4、GoogleのGemma 3、OpenAIのGPT-OSS、全部音声生成はできない。 でもQwen3-Omniだけはテキスト・画像・音声・動画を理解して、さらに音声でも返答できる。 つまり「動画見せて音声で説明して」「リアルタイム音声会話」が無料でできる唯一のオープンソース。これがApache 2.0ライセンスで商用利用OK、完全無料ってヤバすぎる。 ②実力テストで有料モデルと互角 AIの実力を測る「ベンチマーク」でQwen3-Omniが驚異的な結果を出してる。36のベンチマークのうち22で最高スコア、32でオープンソース1位を記録。 しかも動作に必要なのは30億パラメータだけ。他のモデルが数千億必要なのに。つまり、普通のPCでも動くサイズで、巨大サーバー必要なAIと同等の性能ってこと。 ③動画と音声の同期技術がヤバい 「Thinker-Talker」っていう新技術で、考える部分と話す部分を分離。これで0.234秒(まばたきする間)で音声返答できるようになった。さらに「TMRoPE」技術で動画と音声のタイムスタンプを完璧に同期。 動画見せて「これを日本語吹き替えして」って言ったら、音声タイミングを合わせて吹き替えできるレベル。 ④音声AIビジネスが爆発的に広がる OpenAIのRealtime APIは音声会話できるけど、100万トークンで入力40ドル、出力80ドルかかる。 でもQwen3-Omniなら同じような機能を自社サーバーで無制限に使える。これで何ができるか? AI Vtuberの音声をリアルタイムで生成する配信。バーチャルAIインフルエンサーが動画を見ながら実況。視聴者の動画に多言語音声を自動でつける機能も、タイミングを合わせて生成できる。 さらに、オンライン語学学習アプリ、AIカスタマーサポート、音声ガイドアプリ。 全部APIコストゼロで、リアルタイム音声対話が可能になる。(誰か精度検証お願いしますw) というわけで、音声対話AIを開発するなら、Qwen3-Omni試さない理由がない。AI Vtuberから動画翻訳まで、音声生成できる唯一のオープンソースAIだぞ。

Tom | ドバイで生成AIやってる人

46,269 次观看 • 10 个月前

💡 動画生成AIは余白で動きを決める 🎥 左右の動画を見比べてみましょう。 右のこぢんまりとした動きに対して、左のキャラは身体全体を使った動きをしてます。 実はこの二つの動画「同一プロンプト・同一素材」で生成してます。 なら違いは何か?左の素材画像に対して余白を追加しているのです。 余白の分だけ、キャラクターの動く余地が生まれます。同じプロンプトなのに、より大きい動きが可能になります。逆に動きが大きい場合は、対象キャラクターをフレームギリギリまで近づけることで動きを抑制できます。 もちろんプロンプトでも動きを調整できます。しかし、動きのポテンシャルは余白の有無で決まっているように感じるのです。 以下は優先度の仮説です 1. 動かすだけの余白があるか(フレームとキャラクターの比率=提供画像) 2. その中でどれだけ動かすか(プロンプト) 個人的にはかなり本質的な発見です。 最終的なショットと生成に相応しいショットが異なることを示すからです。このギャップを認識していないと、動画生成AIから十分な性能を引き出せないことになります。 あくまでも生成用にショットサイズを調整して出力、その結果を後でトリミング&アップスケールで編集に回す、という工夫が必要かもしれません。 生成AIは実写やアニメと異なり、アクター/モデルとフレームの関係が逆転しています。フレームが先で、その中で初めて演技もキャラクターも生成されるのです。この違いを認識することが重要なのではないかと思いました。

NOBU

172,881 次观看 • 1 年前