正在加载视频...

视频加载失败

Claudeが自分の声で喋れるようになった。 全言語対応、無料。 Github上の「voicebox」というリポジトリを使えば、数秒の音声だけで声をクローンできる。 ↓

199,258 次观看 • 1 个月前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

✨AI音声で一貫した声を作り会話させるチャレンジ 前に音声を使ってLLMの文章を読ませることには成功していたけど、今回はオリジナルの声を作成してみました。 やったこと: ①まずQwen3-TTSで声を1個作る ②その声で171個量産(台詞バリエーション) ③Style-Bert-VITS2で学習 → 50分でカスタム音声モデル完成 ④UIに接続 → リアルタイムで喋る やばい!自分で作った声だと楽しい😊 苦労したところ: ・最初はブラウザ内TTS(Chatterbox)を試した → 1文30秒&英語のみでまだ難しいしそもそもこの用途が厳しいかも💦 ・SBV2に切り替えたら環境構築に手間取ったけどうまくいった ・ただライセンスは要注意。やる場合は先にライセンス確認を。用途によっては制限があるものもある📝 まだまだ色々あるけど、今後のことを考えるとNVIDIAからも良い音声AIが出てるし、対応できるようにしておきたい。 今回は前回と同じくモデルはGPT-OSS 20Bだけど、Ollamaから読んでるので早い。 WebGPUでこれぐらい出たら嬉しいけどなー🥰 とはいえローカルでここまでできるようになったのは嬉しい。データは一切外に出ないしね。 声の元はAI生成だから、「存在しない人の声」をAIが学習して、AIキャラが喋る。 #AI #TTS

LUTA@AI

57,505 次观看 • 6 个月前

No.29の掛け声について そもそも掛け声を1回だけやるのか、それとも曲が終わるまで繰り返しやるのかによっても変わってくるはずですが、当方は一旦繰り返し続けていくという前提として、一度試算してみました。 ・曲の長さ:1分38秒 ・掛け声スタート時点:3秒 ・最後まで掛け声を繰り返し実施する際の時間:(3秒のスタート時点を入れて)96秒間 ※入れなければ、95秒間だが、誤差レベルなので、ここは一旦96秒間と考える。 そうなった場合、割り算的に最もきれいに実施できる回数は8回となり、1回の掛け声あたり、約12秒という目安になります。 ※最後のBTSの部分の余韻を含む これだけだとリズム感的に難しいかと思いますが、参考にできるものとして、歴代の掛け声で最もリズム感が近かったものが「Mic Drop」だと考えられます。 ・今回理想とされる1回あたりの掛け声の長さ:約12秒 ・「Mic Drop」のイントロの1回あたりの掛け声の長さ:約11.4秒 つまり、「Mic Drop」の掛け声を【気持ちゆっくり目】にやれば、きれいに収まるという試算となります。 文章だとわかりにくと思うので、当方の気持ち悪い声で恐れ入りますが、一度試してみたので、動画も合わせてご覧いただければと思います。 ※あくまで私の持論なので、「この曲の掛け声のリズム感の方が近い」「8回やらないと思う」という反論あれば、書いていただいて全然構いません。

デイビッドパク / 데이비드 박

162,273 次观看 • 4 个月前