[ロング レビュー] スピーカー検証からマルチスピーカー音声合成への転移学習
この論文は、ゼロショット音声クローニングを実用的にした論文です。数千の雑音を含む、トランスクリプト不要の音声でスピーカーエンコーダーを判別検証タスクで訓練し、これらの埋め込みをTacotron 2 s
この論文は、ゼロショット音声クローニングを実用的にした論文です。数千の雑音を含む、トランスクリプト不要の音声でスピーカーエンコーダーを判別検証タスクで訓練し、これらの埋め込みをTacotron 2合成器とWaveNetボコーダーに入力します。結果として得られるTTSシステムは、数秒の参照音声から新しいスピーカーを模倣でき、訓練中に見たことのないスピーカーでも機能します。
GoogleのJia et al.による研究についてのこのロングレビューは、3つのモジュール全てについて詳しく説明しています。判別目的で訓練されたスピーカーエンコーダー、埋め込みを条件とした系列対系列メルスペクトログラム合成器、自己回帰型WaveNetボコーダーです。また、エンコーダーで一般化するために必要なスピーカーの多様性の量を定量化するアブレーション研究や、ランダムにサンプリングされた埋め込みが首尾一貫した新規な音声を生成するという驚くべき結果についても説明しています。音声クローニング、パーソナライズされたTTS、またはスピーカー埋め込みスペースで何かを構築している場合、この論文は必読であり、詳細な解説がすべてをカバーしています。
