Loading video...

Video Failed to Load

Go Home

ByteDanceの音声生成AI 「Seed Audio 1.0」 使用感はこんな感じでした! ・Seedance2.0での音声出力より日本語が安定 ・セリフに沿って感情表現を微妙に合わせてくれる ・音声と画像は同時にリファレンス不可 ・音声のリファレンスの精度が高い(Max30秒) ・高い声だと機械音っぽい感じが出やすい 用途にもよりますが、ElevenLabsより使いやすいかもしれないです…👀 またじっくり検証してみます!

34,296 views • 2 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

🎊🎊様々なキャラクターたちの声で音声合成できるサービス”Kotodama”をリリースします🎊🎊 感情豊かなキャラクターの声で、新しい物語を紡いであげてください。HappyRatの他のキャラクターや、HappyRat以外のキャラクターも順次登場予定です。 お楽しみに! -------- 僕達は感情豊かなキャラクターAIを作っています。その中でも、声は欠かすことができない要素で、こだわりを持ちながら音声合成エンジンを作っています。 フルスクラッチの学習からスタートして、感情豊かな表現を出すためにモデル自体を改良したり、より自然な表現になるよう日夜アノテーションで性能改善を進めたり。 ・・・そんなことを積み上げていたら、いつの間にか「リアルタイム (<0.5秒)」「キャラクターの声色の再現」「豊かな感情表現」の三拍子揃ったモデルになっていました。 これまでは弊社アプリからのみ利用可能な状態にしていましたが、様々な企業様やクリエイターの方から、ぜひ誰でも簡単に使えるようにしてほしいとご要望をいただき、晴れて独立したサービスとしてローンチすることになりました。 特に自信があるのは、リアルタイム性と感情表現の豊かさです。API経由でも使えますので、リアルタイム対話アプリケーションにもぴったりです。 感情表現については・・・そうですね、ここまで本気で、泣いたり笑ったり出来る音声合成エンジンは、これまで無かったのではと思います。 ぜひ実際のサービスで体験してみてください‼️ #ハピラト #kotodama #音声AI #AIVOICE #AI

佐々木雄一 (MoMy; SpiralAI CEO)

78,909 views • 10 months ago

今回は Void Gaming さんより、話題のコントローラー「FireBird」をご提供いただいたので、忖度なしで正直にレビューします。 これまで DualShock 4 を使用していましたが、FireBirdに変更してまず感じたのは「遅延の少なさ」です。 撃ち合いで「あと少し追えない」「反応が一瞬遅れる」と感じていた場面がありましたが、FireBirdに替えてからはしっかり追えるようになりました。 これは気のせいではなく、明確に体感できた変化です。入力に対するレスポンスがとにかく速いと感じました。 スティックの操作感も非常に良好です。 他のコントローラーを多く使ってきたわけではありませんが、それでも違いがはっきり分かるレベル。エイムの安定感が一段階向上した印象があります。 背面ボタンは好みが分かれる部分だと思いますが、私はリロードを設定しています。 親指をスティックから離さずに操作できるため、撃ち合い時の安定感につながっていると感じました。 これだけの性能を持ちながら、コストパフォーマンスが高い点も魅力です。 今回は提供品として使用させていただきましたが、個人的にももう一台購入を検討しています。 一方で、気になった点もあります。 起動時に接続がやや不安定に感じることがあります。プレイに大きな支障はありませんでしたが、人によってはストレスに感じる可能性があります。 また、スティック感度が良い分、最初は指先が少し震えて疲れやすく感じました。 ただし、数日使えば自然と慣れる範囲だと思います。 総合的に見ると、FireBirdは自分のポテンシャルを最大限に引き出してくれるコントローラーでした。 本気で上達を目指している方には、十分検討する価値のある製品だと感じています。 以下はFireBird使用時のクリップです

ちこちゃんだお🐟🪇【BS】

83,013 views • 6 months ago

フォルマント...と聞くと「ウッ」となる方へ。少しだけ読んでみてくれませんか。 まず、アプリを作ったので、よければ遊んでみて下さい。感覚的に、F1くん、F2くんを動かしてみて欲しいんです。 まずこの紫の縦棒がなんなのか。 これはスペクトラムビューと言いますが、左から「基音(きおん)」いい、そこから順番に第2倍音、第3倍音...といいます。 ⚫︎前提...倍音はどんな声にもあるよ 前提として、自然界の全ての音には倍音が含まれています。ここを勘違いしていると、フォルマントの理解までは到達することができないと思います。 ときおり、「あなたには倍音がないのよ」など生徒に言ってしまう先生方もいらっしゃいますが、実際にはありえないのであって、何か違うことを伝えたかったということになりますね。 ⚫︎どの倍音が強調されているかで音色は変わることがあるよ 第2倍音、第3倍音は何が違うのですか、とも聞かれますが、音の高さが異なります。 第2倍音であれば、基音からオクターブ上、第3倍音であれば、オクターブ+5度上。 第4倍音であれば基音から2オクターブ上。基音との音程は決まっています。基音が変われば倍音たちも高さが一緒に変わります。 そして、この、どこの倍音が強調されているのかが音色に関わっている、ということです。そしてそのどこの倍音を強調させるかを調整することができるのがーーフォルマントという概念です。 ⚫︎フォルマントを動かして、倍音と出会わせる。倍音を強調する。 アプリは、フォルマントを可視化および、キャラクター化しています。実際にはこういうキャラクターが喉の中にいたりしませんよ!笑 動画では、フォルマントの世界でよく聞く、F1、F2(第1、2フォルマント)を動かしています。このようにフォルマントくんたちは、自分の意思で歌手にコントロールされます。共鳴腔のサイズ調整によって、変化します。 これらをF1くん、F2くん、と一旦呼んでみましょう。倍音の下に顔がありますよね?彼らです。 まず最初に、F1くんを基音のところに持っていきます。そうするとなんだか、裏声感が強まった感じがします。母音がより奥まった感じがしますね。 第2倍音のところにいくと、母音が少し開いて、「あ」に接近した感じがしますし、やや地声のような音色に聞こえます。 動画後半では、F2くんを動かしてみています。F2くんを高めに設定して、より高い倍音を強調させると、い、や、え、のような響きを帯びてくるのがわかると思います。 F1くんもF2くんも、歌手ならば自分の意識下の制御をし、自由に設定することができます。(テクニックですね!) またここでわかるのは、歌手はこうしてF1、F2を設定することによって複数の倍音を、意識して、もしくは無意識の中で「これが欲しい音だ」という意図の中でコントロールしていることになります。すごいことだ。 ⚫︎「カップリング」 ちなみに、アプリのUIのお気に入りポイントがあります。倍音とフォルマント君が一致することをカップリングと言いますが、カップリングすると、フォルマント君の顔がハートになります。 倍音とフォルマントが出会う、、のようによく冗談混じりで話すのですが、それをイメージしています。 F1くんとどの倍音を出会わせるのかで音色は大きく変わります。アプリでも試してみてくださいね。 ※僕は研究者ではなく、ボイストレーナーです。解説に問題が孕む可能性があります。僕が知っている知識で、かつ、歌手が苦手に感じる語彙をカットしながら説明してみました。補足はチームメンバーの浅野千尋音声ちんどり浅野千尋 、佐々木洋平佐々木洋平 | テノール歌手 に委ねます。

岩崎 大貴 | 株式会社ARIA代表

209,343 views • 2 months ago

最近、YouTubeのコメント欄に「某声優さんにそっくり」「AIだろ」「訴えられろ」みたいなコメントが急増しています。 親父譲りの声でお話しているだけなのですが…せっかくなので、声の類似性について音声学的な話を少し。 人間の声は、声帯で作られるピッチと、声道(喉・口腔・鼻腔)の形状で決まる共鳴特性によって成り立っています。 声道の長さ・形状は、身長や骨格と強く関係しており、個人差も大きい。 ですが80億人もいるので、色々な条件の組み合わせの中で「似た声」が出てくるのは、生物学的に自然な現象です。 顔の「そっくりさん」がいるのと同じ理屈です。 むしろ、顔は似せるために極めて多くの条件が同時に一致する必要がある一方で、声は連続的な変数が多く、完全に一致しなくても「似た音色」として聞こえやすいのです。 つまり、「声の出力(聞こえ方)」が似る確率は、「顔が似る」確率より高い傾向があるということです。 実際、法廷音声鑑定の分野では、声は指紋ほど完全にユニークではなく、似た声の誤認リスクは常に議論されています。 特に双子研究では声の類似性が非常に高いケースが多く報告されています。 つまり「似てる声」は普通に「あるある」なのです。 僕の場合は、完全に親父と瓜二つの声であって、誰かの声を学習させたAIでも声真似でもありません。 (ちなみに副鼻腔炎になりやすい鼻腔なので、似てる人は副鼻腔炎持ち率が高いかも…?) ということで、これを読んだ人は「似てる声」は「顔が似てる」と同様に、ただのあるあるなんだということを、新しい知見として認識してもらえると良いなと思います。 そして、誤解している人を見かけたら「違いますよ」と指摘していただけますと幸いです。 ※ただし、これは自然に生まれた声の話です。 特定の声優の声をAIに無断で学習させて、収益化するのは全く別問題です。 おそらく最新の分析技術であれば、生声か学習かくらい判別できそうですが、どうなんでしょう??🧐

神のみぞ知る

19,510 views • 3 months ago

ついに第一話のベータ版が出来ました! 今まで散々、Kling3.0、Grok、Sora2でパイロット版を作りまくったのでSeedance2のクレジットをあまり無駄にせず済みました。 やはりストーリー物は映像の繋ぎ方が難しいですね どれだけ違和感をなくして、自然に見ることが出来るかに注目して作りました。 細かくみると大味ですが、初見だとそんなに気にならないレベルまで作れたかな?と思っておりますが みなさんどうでしょう? 気になる箇所とかありますか? あとは第一話の主人公VICの声って、気になりますか? 毎回、変わっちゃっている気がします。 言われないと気にならないレベルですか? それとも違和感ありまくりですか? まぁAIだからしょうがねーやくらいの目で、大目に見ている感じですか? 本当はHiggsFieldの機能で修正声だけ修正しようとしたのですが、私の使い方が悪いのか全然ダメでした。 正直、喋っている感じはこのままでいいのです というかこのままがいいのです 声だけ統一したいんですよね みなさんに教えていただいた ElevenlabsやMiniMaxも試してみましたけど、これ喋りを1から作ることになってしまいますよね? #seedance2 #Sjinn

AIスタジオワンルーム(AIアニメ、動画、漫画)

50,227 views • 5 months ago