三つ子のようなロシアのフィギュアスケーター:Kullback-Leiblerダイバージェンスは彼らの違いを見分けるのに使用できますか?
スピーカー適応は、エンコーダーの獲得した音響表現を損なわないようにシーケンス・ツー・シーケンスモデルを適応させようとするまでは、解決されたように聞こえるASR問題の1つです。
スピーカー適応は、エンコーダーの獲得した音響表現を損なわないようにシーケンス・ツー・シーケンスモデルを適応させようとするまでは、解決されたように聞こえるASR問題の1つです。このトークは、ほぼ同じロシアのフィギュアスケーターの記憶に残るフレームを使用して、KL divergenceが非常に似たスピーカー分布を区別できるかどうかを尋ね、「Listen, Attend, Spell and Adapt」:ベースモデルを完全に保持しながら、軽量なスピーカーごとのコンポーネントを学習するスピーカー適応seq2seq ASRアーキテクチャを詳細に説明します。
KL正則化が適応中の劇的なドリフトを防ぎ、適応データの予算がWER改善とどのようにバランスするか、なぜLASスタイルの注意エンコーダーがハイブリッドHMMシステムと比較して適応下で異なるように動作するのかについて、慎重に検討することを期待してください。パーソナライズされた音声インターフェース、音声クローニングスタック、またはユーザーごとの音響プロファイルを備えた音声入力製品を構築している人にとって、ここのアイデアはConformerとトランスデューサーベースのシステムに直接適用されます。スピーカー適応がASRスタックでの単なる好奇心以上である場合は、再生をクリックしてください。
