[Detailed Paper Reading] Zipformer: A faster and better encoder for automatic speech recognition

Tutorials

【詳細論文読み解き】Zipformer: 自動音声認識のための高速でより優れたエンコーダ

Conformerはここ数年、デフォルトのASRエンコーダでしたが、k2/icefallチームのZipformerは静かにLibriSpeech、Aishell-1、WenetSpeechでWERの冠を奪い取りました。より高速でより軽量です。

Conformerはここ数年、デフォルトのASRエンコーダでしたが、k2/icefallチームのZipformerは静かにLibriSpeech、Aishell-1、WenetSpeechでWERの冠を奪い取りました。より高速でより軽量です。このレビューは、U-Netスタイルのエンコーダがフレームレートを低下させるために中央のスタックをダウンサンプリングし、サブモジュール全体で注意重みを再利用するように再編成されたブロック、レイアウト情報を保持するLayerNormのBiasNorm変種、および新しい活性化関数(SwooshRとSwooshL)がSwishよりも優れているレイアウトについて、正確にどのように実現されているかを説明します。

このウォークスルーはアーキテクチャに止まりません。Zipformerはパラメータごとに更新をリスケーリングし、パラメータスケールを明確に学習するScaledAdamという新しいオプティマイザとともにリリースされており、同じレシピでAdamより高速に収束しています。各設計選択はそれを正当化する削除によって明確にされており、どのトリックが一般化し、どのトリックがU-Netトポロジーに関連しているかを見ることができます。本番環境でASRエンコーダを保守している場合、または次世代Kaldiが大きなコンピュートバジェットなしで最先端を設定し続けるのはなぜかに興味がある場合は、再生ボタンを押してください。これは、抽象的ではなくエンジニアリングについて深く掘り下げた珍しい論文読み解きです。