[ロングレビュー] CLAS: ディープコンテキスト: エンドツーエンド文脈的音声認識
ASR製品をリリースした人なら誰でも固有名詞の苦労を知っています: 連絡先の名前、曲のタイトル、医薬品の名前、不明瞭な地名。
ASR製品をリリースした人なら誰でも固有名詞の苦労を知っています: 連絡先の名前、曲のタイトル、医薬品の名前、不明瞭な地名。CLASまたはContextual Listen-Attend-Spellは、そのコンテキストをエンドツーエンド音声認識器に直接注入するためのGoogleの答えです。事後的にビームサーチをバイアスするのではなく、CLASはバイアスフレーズのリストに対する注意メカニズムを学習するため、モデルはリトレーニングなしにデコード時にユーザー固有の語彙を活用できます。
このロングレビューは、アーキテクチャ、バイアス注意を干渉に対してロバストにする訓練技法、および現実的な音声アシスタントタスクでのWER改善について説明しています。オンデバイスASR、ディクテーションアプリ、またはパーソナライゼーションが重要な音声インターフェースを構築している場合、CLASは数年後でも基礎的な読みのままであり、そのアイデアは現代のRNN-TおよびCTC文脈的バイアシング作業に引き続き出現しています。文脈的バイアシングがASRロードマップにある場合は、ノートブックを開いてフォローしてください。
