Loading video...

Video Failed to Load

Go Home

【検証】Gemini 3.8 Flash TTSで、自分の声をクローンしてみた 結論、クローンの精度が高い。個人的には、ElevenLabsの有料のプロ向けクローンよりも良いかなと思いました。(普通の読み上げは3.1 Flash時点でも精度高かったので、まあまあという印象でした。) ・約24秒話して、同意文を読むだけで声をコピー ・英語も中国語も、自分の声のまま話せる ・標準の声は前のモデルから優秀で、そこは大差なし 私は動画作成で音声をめちゃくちゃ使うので、かなり重宝してます。 今回の図解アニメはClaude Opus 5.5、声はGemini 3.8 Flash TTS、冒頭の顔と声はSeedance 2.5。この3つで、大体のショート動画は精度高く作れるかなと。

34,173 views • 2 days ago •via X (Twitter)

3 Comments

はな🌸"あなたの色"で輝くお手伝い's profile picture
はな🌸"あなたの色"で輝くお手伝い2 days ago

「声」だけで考えると ものすごく精度高いですね👀 イントネーションは茶圓さん本人と違うなって感じるから "クローン"としての向上を今後に期待、と思います☺️ (今のようにAIと本人の判別をできた方が安全かも、ともちょっと思います🧐)

まぁる@YouTube×AI自動化の設計士's profile picture
まぁる@YouTube×AI自動化の設計士2 days ago

ElevenLabs超えてくるならAPI連携のコスト感も一気に変わりそうです🔥

おぢ、AIを雇う|社員ゼロで11年's profile picture
おぢ、AIを雇う|社員ゼロで11年2 days ago

社員ゼロで11年の一人社長です。自分の声で話せるなら、うちで最初に任せたいのは取引先への折り返し電話の一言目です。一人会社は、電話に出た瞬間に手が止まるのが一番重いので。

Related Videos

✨AI音声で一貫した声を作り会話させるチャレンジ 前に音声を使ってLLMの文章を読ませることには成功していたけど、今回はオリジナルの声を作成してみました。 やったこと: ①まずQwen3-TTSで声を1個作る ②その声で171個量産(台詞バリエーション) ③Style-Bert-VITS2で学習 → 50分でカスタム音声モデル完成 ④UIに接続 → リアルタイムで喋る やばい!自分で作った声だと楽しい😊 苦労したところ: ・最初はブラウザ内TTS(Chatterbox)を試した → 1文30秒&英語のみでまだ難しいしそもそもこの用途が厳しいかも💦 ・SBV2に切り替えたら環境構築に手間取ったけどうまくいった ・ただライセンスは要注意。やる場合は先にライセンス確認を。用途によっては制限があるものもある📝 まだまだ色々あるけど、今後のことを考えるとNVIDIAからも良い音声AIが出てるし、対応できるようにしておきたい。 今回は前回と同じくモデルはGPT-OSS 20Bだけど、Ollamaから読んでるので早い。 WebGPUでこれぐらい出たら嬉しいけどなー🥰 とはいえローカルでここまでできるようになったのは嬉しい。データは一切外に出ないしね。 声の元はAI生成だから、「存在しない人の声」をAIが学習して、AIキャラが喋る。 #AI #TTS

LUTA@AI

57,505 views • 7 months ago

最近、YouTubeのコメント欄に「某声優さんにそっくり」「AIだろ」「訴えられろ」みたいなコメントが急増しています。 親父譲りの声でお話しているだけなのですが…せっかくなので、声の類似性について音声学的な話を少し。 人間の声は、声帯で作られるピッチと、声道(喉・口腔・鼻腔)の形状で決まる共鳴特性によって成り立っています。 声道の長さ・形状は、身長や骨格と強く関係しており、個人差も大きい。 ですが80億人もいるので、色々な条件の組み合わせの中で「似た声」が出てくるのは、生物学的に自然な現象です。 顔の「そっくりさん」がいるのと同じ理屈です。 むしろ、顔は似せるために極めて多くの条件が同時に一致する必要がある一方で、声は連続的な変数が多く、完全に一致しなくても「似た音色」として聞こえやすいのです。 つまり、「声の出力(聞こえ方)」が似る確率は、「顔が似る」確率より高い傾向があるということです。 実際、法廷音声鑑定の分野では、声は指紋ほど完全にユニークではなく、似た声の誤認リスクは常に議論されています。 特に双子研究では声の類似性が非常に高いケースが多く報告されています。 つまり「似てる声」は普通に「あるある」なのです。 僕の場合は、完全に親父と瓜二つの声であって、誰かの声を学習させたAIでも声真似でもありません。 (ちなみに副鼻腔炎になりやすい鼻腔なので、似てる人は副鼻腔炎持ち率が高いかも…?) ということで、これを読んだ人は「似てる声」は「顔が似てる」と同様に、ただのあるあるなんだということを、新しい知見として認識してもらえると良いなと思います。 そして、誤解している人を見かけたら「違いますよ」と指摘していただけますと幸いです。 ※ただし、これは自然に生まれた声の話です。 特定の声優の声をAIに無断で学習させて、収益化するのは全く別問題です。 おそらく最新の分析技術であれば、生声か学習かくらい判別できそうですが、どうなんでしょう??🧐

神のみぞ知る

19,510 views • 4 months ago

「仕事がなくなる」よりも深いのは「意味がなくなる」恐れだ。産業化は生産を工業化しただけでなく、アイデンティティまで工業化した。「何をしているの?」が「あなたは誰?」になった世界で、AIがタスクを肩代わりし始めれば、次に崩れるのは自己像そのものかもしれない。 アクラム・アワド「AIは私たちを無用にしてしまうのでしょうか? もし働かないなら、私たちは誰なのでしょうか? もし生み出さないなら、私はまだ意味があるのでしょうか? 何世紀にもわたって、私たちは自分のアイデンティティや価値を『何をしているか』に結びつけてきました。農家、工場労働者、コーダー、コンサルタント——仕事と職は、現代の社会における秩序と定義の原理になりました。 ですが、いつもそうだったわけではありません。産業革命の前は、私たちのアイデンティティは信仰や家族や共同体から来ていました。仕事は人生の一部でしたが、それ自体が人生の定義ではありませんでした。そこに工業化がやって来て、私たちは生産だけでなく、アイデンティティまでも工業化しました。『何をしているの?』は『あなたは誰?』の言い換えになったのです。 そして今日のAIは、そのモデルを完全に解体しつつあります。AIはあらゆるタスクを自動化しています。製造や物流、デザイン、顧客対応、さらには創造的な仕事にまで。いまのAIは曲を作り、コードを設計し、本を挿絵化し、そしてそれ以上のこともできます。実際、世界経済フォーラムは、2025年までにAIが人間より多くのタスクを行い、何億という雇用が危険にさらされると予測しています。 ですが、これは仕事だけの話ではありません。意味の話です。尊厳の話です。かつて私たちに価値を与えていたただ一つのものが、時代遅れになったときに何が起きるのか、という話です。そして注意しなければ、私たちは大恐慌に向かうかもしれません。ですが今回は、所得の大恐慌ではなく、アイデンティティの大恐慌です」

Tsubame

93,869 views • 9 months ago

いさ議員「松井氏と木下秘書と思われる方の会話の音声が公表されたが、その音声は木下秘書本人か?」高市総理「有料会員になりたくなかったので確認してない、時間的にもできなかった」いさ議員「何のための事前通告ですか?私が役所に事前通告のお願いをしたのは、昨日の昼過ぎぐらいですよ」 ---文字起こし--- 2026/6/4 衆議院予算委員会 い「昨日この松井氏と木下秘書と思われる方の会話の音声が(週刊文春で)公表されました。事前に通告で総理のサイドにお願いしていたのは、その音声が木下秘書本人かどうか確認してほしいというふうにお願いをしておりましたが、結果いかがだったでしょうか?」 ---(中略)--- 高「ご指摘のオンラインというものを確認しようと思いましたら、これ会員制の有料オンラインなんですね。これまでもこちらの言い分は関係なく、私の面識のない方の言い分を非常にイメージ操作をして報道してこられた、そこの有料オンライン会員になろうとは思いませんでした。 またその方法もありませんでしたので、確認できませんでした。結論として、今朝までに確認することはできませんでした。これはもう時間的なもの、その時点でもまだまだ数十問分の答弁の読み込みが残っておりましたので、有料会員になって音を確認するといったことは、私自身は、とてもできなかったということでございます」 委「いさ君」 い「これ何のための事前通告ですか?」 ---(中略)--- い「役所の方には皆さんに対して、『これはしっかり事前に通告してくださいね』ということでお願いもして、『分かりました』となって、それが昨日の昼過ぎぐらいの時間帯ですよ。その間、もちろん総理ご自身が私の質問を見たのはもしかしたら夜中の3時だったかもしれませんよ。でも事前通告で、これが一番の肝で今回質問も用意させていただいて、それが『前提が何もできませんでした』というのは、私はそれは通らないと思います」

maku

13,468 views • 3 months ago

シンギュラリティのトリガーである「再帰的自己改善」は、すでに少し前に起きているという。もちろん、まだ全自動ではないが、「進歩のどこまでがAIでどこまでが人間なのか」は曖昧になってきている。著者性が溶けるこの感覚こそ、分単位で進むシンギュラリティの手触りなのだ。 サリム・イスマイル「再帰的自己改善(RSI)がシンギュラリティの本当のトリガーだという話は、以前からしてきました。そしてそれは、すでに少し前に起きているんです。だから今やっているのは、その道筋を加速しているだけです。私たちは今この瞬間にも、産業時代を恒久的に抜けつつあります」 デイブ・ブランディン「ええ、シンギュラリティが分単位で展開していく様子は、私が経験した中で最も興味深いものだと本当に思いますし、アレックスの言うとおりです。いまは、人間がループの中にいて貢献している時期ではあるのですが、進歩のどこまでがAIでどこまでが人間なのかが、本当に曖昧なんです。実際にコーディングしていると、『あれは自分のアイデアだったのか?』となります。 半分は自分のアイデアのようでも、AIが別の案を提案してきて、それを採用していくうちに、結局それが自分のアイデアだったのかどうかも分からなくなります。ただ、いまのモードでは、こうしたコアアルゴリズムの研究の多くが、『500本のテストを走らせて、どのハイパーパラメータが良かったか、どのニューラルトポロジーが良かったかを教えて』という形になっています。相対論を発明したり発見したりするような話ではありません。 いろいろな試行を大量に回して、うまくいったものを選んで再デプロイし、そうするとより賢いAIになって、さらに多くの試行をする——その繰り返しです。私たちはその道筋をかなり進んでいる可能性が高いと思います」

Tsubame

15,386 views • 7 months ago

『映画ちいかわ 人魚の島のひみつ』は、原作を超えたのか。 結論から言う。 超えた部分もある。だが、原作にしかない怖さも失われた。 長文です。動画も作りました。 映画化としては、かなり成功している。 しかし、すべてが原作以上になったわけではない。 まず、映画が原作を超えたと感じた点を三つ挙げる。 一つ目は、音である。 漫画では、セイレーンの歌声も、波の音も、攻撃の衝撃も、読者が頭の中で想像する。 だが映画では、それらが具体的な音として押し寄せてくる。 特に、かわいらしい画面と、重く響く音の落差がすごい。 人魚をめぐる真相も、漫画ではコマと擬音によって距離を保てたが、 映画では音が付くことで、行為の暴力性が一気に現実へ近づく。 二つ目は、時間である。 漫画は自分の速度で読める。 怖い場面で止まることも、前のページへ戻ることもできる。 一方、映画は観客を決められた速度で物語の先へ運ぶ。 島へ着いた直後の楽しさ。 島民たちとの交流。 セイレーンの出現。 そして真相。 楽しい時間が少しずつ壊れていく流れを、観客は止められない。 この逃げられなさは、映画だからこそ成立した恐怖である。 三つ目は、登場人物の感情である。 ちいかわが怯える呼吸。 ハチワレが状況を理解しようとする声。 ラッコが危険を前にして見せる緊張。 うさぎの予測不能な動き。 漫画では小さな表情の変化として描かれていたものが、 声と動きによって立体的になっている。 特にヒトハとフタバは、真相を知ってから見返すと、 沈黙や視線の一つ一つが別の意味に見える。 これは映像化の大きな成功である。 では、原作の方が優れている部分は何か。 一番は、余白である。 漫画では、残酷な行為そのものをすべて説明しない。 コマとコマの間に、読者が想像する空間がある。 何が起きたのか。 どんな気持ちだったのか。 この先、二人はどうなるのか。 答えを与えすぎないからこそ、読後に不安が残る。 映画は音と動きで情報が増えた分、原作の曖昧さが少し減っている。 もう一つの弱点は、映画として観ると、 中盤の反復が長く感じられる可能性があることだ。 島での楽しい時間と、セイレーンによる被害を丁寧に積み上げる構成は、 原作ファンにはうれしい。 しかし、初めて触れる観客には、 物語の本当の焦点が見えるまで時間がかかるかもしれない。 そして最大の問題は、映像が豪華になることで、 残酷な物語まで娯楽として気持ちよく消費できてしまうことである。 アクションの迫力。 歌の魅力。 かわいい登場人物。 それらが強いほど、本作が描く罪や責任が薄く見える危険もある。 それでも私は、この映画化を高く評価する。 理由は、原作を分かりやすい子ども向け作品に変更せず、 ナガノ作品の不穏さを残したからである。 原作を超えたかどうかを、勝ち負けで決める必要はない。 漫画は、余白で怖がらせる。 映画は、音と時間で逃げ場を奪う。 同じ物語を、異なる方法で怖くした。 映画を観た人は、ぜひ原作も読んでほしい。 映画で具体化されたものと、漫画で最後まで曖昧なまま残されたもの。 その違いを比べたとき、 『人魚の島のひみつ』という物語の異常な完成度が、さらに見えてくるはずである。 あなたは、映画と原作、どちらが怖かったですか。 コメントで教えてください。

榊󠄀原清一 / 人財版 令和の虎 主宰

44,708 views • 1 month ago

Sora2でカット割り -> Grokで動画化 今回のMVは自作の「Sora2のカット割りツール」を使ったらどれだけ時短できるかの検証をしてみました。下記を満たすのを品質条件にした前提で作業自体は約1時間で終わりました ◇品質条件 --- ゆるいストーリー(気まずい二人のデート)をもった2分半の動画。同一人物の一貫性、彼らの背景など様々なカットを出して「喧嘩してる」「でも二人とも心の中ではそんな小さなことにとらわれてちゃいけないよな」と気づいてはいる、というところまで映像で曲をサポートできている ---- なのでこれをnano-bananaでひとつずつやってくと結構大変です。全体で40カットあるのでその生成と選定で結構時間かかります。 Sora2では「高速なカット割り」とプロンプトすると結構カットを切り替えてくれます。このカット割りがとても優秀なのでこれをフレーム抽出して使う人も増えています。しかし微妙に時間かかります。40カットをポチポチ選んでいく必要があります。 今回はSora2で12秒動画を3つだし、40カットほどのフレーム抽出をしました。 このフレーム抽出リプ欄で紹介しているツールを使うとほんとに数秒で終わります。(今回一番時短したかったポイント!) さて、今回はかなり怠惰な生成アプローチをしたいのでGrokにノープロンプトで投げ続けました。あとはそれをつないだだけです。もっとこだわれるところはめちゃくちゃありますが、今回は上記の品質さえ満たせばOKって感じなのでこの辺は妥協してます Sora2を待っている時間が多分一番長かったのです。Grokは早いですね。途中から僕はただのコピペマシンでしたw てかGrokこれだけじゃんじゃん生成できてクオリティ高いの普通にバグってるわ このSora2のフレーム抽出ツール、需要がありそうなのでちょっと体裁を整えて明日ごろに公開します。別にSora2の動画じゃなくても使えます。一気にフレーム抽出できるのは楽しいですよ!

yachimat - AI Short Anime

36,412 views • 11 months ago