Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

歌声変換モデル 「LeapSVC」をリリースしました👏 歌声合成 LeapSinger を、変換へ拡張して歌声変換に対応しました モデルは将来リリース予定です

12,961 Aufrufe • vor 8 Tagen •via X (Twitter)

9 Kommentare

Profilbild von ゆっきー@音声合成
ゆっきー@音声合成vor 8 Tagen

機能拡張していただけて驚きました! ボコーダーの3.1が動作不安定ですみません…! step数って増やした方が品質は安定していますか?

Profilbild von ようさん
ようさんvor 8 Tagen

素晴らしいリポジトリを使用させていただきました! ステップ数は16までは安定しますが、それ以上は変わらなかったです

Profilbild von ゆっきー@音声合成
ゆっきー@音声合成vor 8 Tagen

音響モデルは16stepでもメチャクチャ速いですね…。自分はM4のMacBook Air使ってますが何か適してないのかも。逆にNHVSingはうちより遅いですね。これだとコア数を増やしてより音質の良いNSF-HiFiGANを使った方が速い疑惑が…。環境差についても参考になります…!

Profilbild von ようさん
ようさんvor 8 Tagen

自分のほうもプロトタイプに近い状態ではあるので、もう少しちゃんと調べて試行錯誤等もしてみます (本当はmoduleやモデルを使いまわさずにしたほうがいいのですが、めんどくさくてスキップしているので...この辺最適化 or 再学習で精度があがりそう?

Profilbild von ゆっきー@音声合成
ゆっきー@音声合成vor 7 Tagen

両モデルのONNXが30秒を超えるような長いフレーズでメモリをかなり食っていたことが分かり、省メモリの処理を入れました。すみません、これは自分のテスト不足です。自分の方とRTFが違った理由はこれもあるかもです…!

Profilbild von ようさん
ようさんvor 7 Tagen

ありがとうございます!取り込んでテストしてみます

Profilbild von Qlour
Qlourvor 8 Tagen

Is it some kind of rvc?

Profilbild von ようさん
ようさんvor 8 Tagen

Not RVC - no retrieval index, no end-to-end VITS/HiFiGAN. It's a rectified-flow acoustic model that predicts mel (NHVSing vocodes it), and the flow starts from a pseudo-mel built from the source F0 instead of Gaussian noise, so 1-16 steps is enough. It does share ContentVec and RMVPE with RVC though, and so far I've only benchmarked against Seed-VC.

Profilbild von ZaneChihuahuaUTAU
ZaneChihuahuaUTAUvor 8 Tagen

Namine Ritsu is even on software that hasn't been released yet. EVERYWHERE!

Ähnliche Videos