Google Researcher's In-Depth Analysis on End-to-End Speech Recognition, Part 1: Overview & Modeling

Tutorials

Googleの研究者によるエンドツーエンド音声認識の深層分析、第1部:概要&モデリング

深層学習の10年間でASRワード誤り率を相対的に50%以上削減し、その過程でクラシックなHMMパイプラインを遺物のように見えるようにしました。

深層学習の10年間でASRワード誤り率を相対的に50%以上削減し、その過程でクラシックなHMMパイプラインを遺物のように見えるようにしました。PrabhavalkarとHoriとSainathとSchlüterとWatanabeによるエンドツーエンドASRサーベイのこのパート1の分解(ラインアップは基本的にはフィールドです)は、E2E ASRモデルの分類法を設定し、最も多くの作業エンジニアが育ったHMM遺産に対してそれをグラウンドします。これは、シリーズの残りをクリックさせる枠組みエピソードです。

この概要はモデリングに焦点を当てています—CTC、注意ベースのエンコーダーデコーダー、およびトランスデューサーバリアントが帰納バイアス、あなたがASRドメイン固有の専門知識への依存を減らすという点で何を購入するか、そして産業がデータからより一貫して学習する全ニューラルスタックの周りに統合された理由において異なります。これは、訓練、デコード、外部言語モデル統合、展開、パフォーマンス分析、およびフィールドの将来の方向に関する後の部分のステージを設定します。モダンASRチームにオンボーディングしているか、KaldiスタイルのハイブリッドとWhisper、NeMo、ESPnet、またはトランスデューサーベースの認識者のようなもの間で決定しようとしている場合、これは地形を歩く前に望む地図です。