Загрузка видео...
Не удалось загрузить видео
話題沸騰のElevenlabs vs Gemini TTS。両者の最新AI音声生成モデルを比較してみました。どちらも自然ですごいです。 Elevenlabsは今回のEleven v4で日本語めっちゃパワーアップしてて今後ますますどのTTSを使うか悩みそうです! 動画はAIアバターを使ったYoutube風の解説動画って感じでOpus 5.5に依頼して作成しました。 音声: Elevenlabs Eleven v4, Gemini 3.8 Flash TTD 画像: GPT-Image-2.5 動画: LTX 2.3 SE: Epidemic Sound BGM: Opus 5.5 台本編集: Opus 5.5 x Hyperframes 環境: Claude Code, Codex CLI, Colab CLI
1,096,508 просмотров • 2 дней назад •via X (Twitter)
Комментарии: 47

同じ台本で並べると、違いがはっきり聴こえますね! Eleven v4は本文の[ ]で演技を指示しますが、Gemini 3.8 Flash TTSは本文を一字一句の台本として読み、感情や速さは別欄のstyleに書く作りなんです。 聴き比べるときは、指示の置き場所を移し替えておくと条件がそろいます。

はい!しっかりと条件を揃え、明確にしての比較がいつも大事だと思っております。

めちゃくちゃ凄いんですけど、まだやっぱり映像に乗せると、AIって分かっちゃうんですよね😅 でもそれも後1~2年で違和感無くなっちゃうのかなぁ🤔

そうですね!私もそこそこのところまではきたと思っていますが、全く満足しておらず日々どうすればもっとAI感が消える格闘中です。ただ、この進化の感じだとおそらく1-2年後にはマジで区別がつかなくなるような気がしています。そして私が今のツールの範囲内で改善試行錯誤していることも軽く凌駕されて全て吹き飛ぶと思います笑

音声・画像・動画・BGMまで、何をどれで作ったかを1行ずつ書いてあるのが、真似する側にはいちばんありがたいですね。会社員の用途だと、資料を耳で確認する読み上げが入口になりそうなので、Gemini Notebook側で「未決の項目だけ先に読む」台本にできるか、そこから入ってみるつもりです。

ありがとうございます。そう言っていただけると幸いです!それはいいアイデアかもしれないですね!LLMでどこを読むか判断して、テキストを抽出してTTSで読む感じですね。朝一番の習慣とか通勤中とかに使えると便利かもですね!

読む場所をLLMに先に選ばせて、TTSは読むだけ、という分担が分かりやすいです。通勤中に聞くなら、前日の議事録の宿題と期限だけで十分かもしれません。

Gemini圧勝だなぁ

Elevenlabsの方がいいという方もいらっしゃるので、それくらい僅差というかどの視点で評価するかで変わる感じなのかもしれないですね🙇♂️

素晴らしい比較でした! ありがとうございます。

ありがとうございます!少しでもご参考になれば幸いです!

読み上げ用途で選ぶなら、同じ30秒の原稿に「固有名詞/数字+単位/短い会話」を入れて聞き比べると、好みと実用上の違いを分けやすそうです。誤読した箇所と、読みを直して再生成した回数もメモする。声の自然さに加えて「納品できる音声になるまでの手直し」で比較すると、用途ごとに選ぶ材料になります。

そうですね。色々と条件を振って、品質の安定性、ばらつき、ストレス条件でのロバスト性などを測るのが、ガチで検討するには必要ですね!私も本業は製造業の技術系会社員なのでそこらへんの感覚わかる気がします。今回のは非常に容易な比較なのでどこかでそれくらいガチの比較検討をするとまたそれが有益な方もたくさんいるかもしれないですね!

これ動画の方がすごいんですがどうやって作られたのでしょうか???

なんと😅ありがとうございます!基本Claude Code上でOpus 5.5が私のフィードバックの元、作成しています。女性が喋っている動画は画像生成で作った女性の画像にここで紹介している音声をつくって、それを入力して、LTX2.3というオープンウェイトの動画生成AIのリップシンク用のワークフローを使って作っています。 字幕やアニメーション、素材の切り貼り、構成編集は全てOpus 5.5がHyperframsというコードベースで動く動画編集ツールで作成しております。Opus5.5がめっちゃすごい感じです笑

詳しくありがとうございます。参考にさせていただきます🙇🙇

少しでもご参考になれば幸いです!

@tetora_bitmap チャッピーの契約しているモデルによるかもだが Google AIスタジオとかで作る 動画はチャッピーに自動で作らせるみたいなのはできそうだけど やっぱり動画作成なら、動画作成のAI!みたいに それに特化したAIを使ったクオリティー高いんだろうなぁ

@tetora_bitmap 何事もその役割に特化したAIと総合的に強いAIの使い分けが大事かなと思ってます。ただ、最近は総合型が専用型を飲み込んでしまうような勢いもあるので、アンテナを貼ってフラットに見ていかないといけないと思っております!

ツール一覧が動画本編より情報量多くて、クレジット欄が主役になってますね

そうですね😅それは私も認識しています。以前一度やめたのですが、これがないと後から自分で振り返った時にこの動画をどうやって作ったか思い出せないので、実質私のメモ代わりとしてまた再開した感じです笑 本当こうじゃなくて返信欄に入れてもいいかもしれないですね。。

さすがGemini 人間らしさがあるなぁ

Geminiは自由にカスタムボイスもプロンプトで作れたりするので、そこを最適化するともっと人間らしさが増すかもしれません。

Geminiが全体的に中国ドラマの吹き替えっぽい Eleven4が日本のドラマの演技に近いのかな

確かになんか演技とかナレーションっぽくも聞こえますよね。私は今このスタジオ録音っぽい違和感をなんとかその場でスマホで撮ったみたいな音声にするにはどうしたらいいかを思案しているところです😅

Eleven v4ならチューリングテストパス出来そう。Gemini TTSはバレるね。

自然さで並ぶと、次に差が出るのは固有名詞と数字の読みでした。自分の環境だと社名や型番を何度も言い直させられて、結局そこだけ読み仮名で渡す運用に落ち着いています。v4の日本語はそのあたりの読み間違いも減っていましたか

確かにそう言ったストレステストをしないと真に実務での使用に耐えうるかの判定ができませんね😅そう言った評価はまだできていないので、折を見て実施してみようと思います!

5:12秒!? 完全AIでこれはすごい。。。

今回は一発生成とは行かずに何度かOpus 5.5とやり取りの末、ここまでたどり着きました😅今回の学びをSkillに落とせば次回以降はもっとやり取り少なくこれくらいまではいけるかもしれません。あとは大分なおしたのですが少しLTXに特有の変な表情とか目が泳いでるところがあるので、そこら辺も要改善ですね。。いつもはこれくらいの画角ならそんなこと起きないのですが、なぜかLTXの調子が悪かったです。。笑

みんな使ってるから!? ですかね。。。 どんどん使う人が増えそうですね。。。 これは。

方言は単語が方言なだけで、 イントネーションは、ちょっと標準語よりな 感じがしますね💦

はい、そうですよね💦個人的には特にElevenlabsはその傾向が強い気がします。私が今回紹介したどの方言もネイティブでないので、説得力にはかけますが😅私のネイティブの出雲弁でやると判定できるかもしれないのでまたやってみます笑

ゴールゴールゴールの所ちょっとやっぱり本物のシーンでは無いような発音になってたから、そういうところはまた直せるのかな?

はい、私は大のサッカー好きなのですが、この実況にはかなり違和感があります。ElevenLabsの方がましですがもう少し高揚感というか絶叫感とか声が伸びる感じが欲しいところです。おっしゃる通り、プロンプトとか感情設定とか選択するボイスでもう少し最適化できるかもしれません。

これ、、いくらぐらぃするんだろ

計算したところ、だいたい250円くらいでした!170円が動画生成に使った、Colabの使用料金って感じです。音声生成自体はGeminiが50円弱、ElevenLabsは無料枠のAPIでやっているので無料です。そのほか細かなAPIが入って、250円弱くらいです。動画生成の170円は結構何回もやり直したので、最適化してやり直しを減らせば半分以下くらいまで減る可能性があります。 ※Claude CodeやCodexのサブスク代は入ってません。

音声比較の話のはずが、最後のツール一覧が本編より長くてそっちに目が行きました

他の方にも指摘されました😅ごもっともで以前一度これを無くしたことがあるのですが、いろんなツールを試しまくってることもあり、そうするとあとから振り返った時にその動画をどのツールで作ったのかわからなくなってしまう傾向があったので、本文が長くなることを承知の上で自分のメモも兼ねてつけてます。。

AI音声って、声紋取れるのかな? 今後犯罪で使われる事を考えると、声紋分析でどのAI音声で誰が作ったかくらい判る様にしないと、犯罪に多用されるだろう。

声の訛りが、ジョンカビラさんみたいな日本語を話すアメリカ人になっちゃってるので、取ったデータ元がアメリカで日本語喋れる人 なのかもですね

すご!誰でもSHELLYになれるのか!

イレブンラボは元気良い! Geminiは優しそうな声。 そんな違いを感じました。 面白い比較検証動画、ありがとうございます😊

声優の仕事は終わりやな

すごいですね👏 もう2年も経てば区別不可能になりそうです。 寝ながらオーディブル小説をよく聴きますが、 作品によっては声が嫌とか読み方が気になるのがあって、 それでやめてしまいますが、 どんな小説でも自分の好みの朗読にカスタマイズして 聴けるようにもなりますね。小説の感情もAIが全部理解

アナウンサーいらないやん

elevenlabが綺麗だなぁ
Похожие видео
Sensitive content
先ほどSuperGrokに入ってみまして、ためしに画像生成をしてみまして、動画も作ってみたというわけなのです… (モデルは18歳以上です)
きゃんなん#61
102,500 просмотров • 3 месяцев назад
