UniSpeech-SAT : Universal Speech Representation Learning with Speaker Aware Pre-Training

Tutorials

UniSpeech-SAT: スピーカー認識事前学習による汎用音声表現学習

自己教師あり音声モデルは音韻内容を見事に学習する傾向があるが、スピーカーアイデンティティは後付けになる傾向がある。これはASRには問題ないが、スピーカー検証、ダイアリゼーション、音声クローニングには最悪である。

自己教師あり音声モデルは音韻内容を見事に学習する傾向があるが、スピーカーアイデンティティは後付けになる傾向がある。これはASRには問題ないが、スピーカー検証、ダイアリゼーション、音声クローニングには最悪である。UniSpeech-SATはMicrosoftの製品で、明示的なスピーカー認識目的をHuBERT様式の事前学習に注入することでこのギャップを埋める。発話単位のコントラスティブ損失と発話混合によって、エンコーダーに何を言っているかだけでなく、誰が話しているかを表現することを強制する。

その効果はSUPERBベンチマーク全体で表れ、UniSpeech-SATはスピーカー識別、検証、ダイアリゼーションで特に強い結果を出し、ASRと音素認識でも優れている。このセッションでは、発話混合がどのように構築されるか、なぜ追加のコントラスティブ項が内容学習を損なわないのか、そしてこの設計がその直後のWavLMへの道を切り開いた経緯を説明する。音声を区別する必要があるシステムを構築しているなら、会議トランスクリプションから生体認証まで、10分の価値がある。