[Olewave's Review] Branchformer: Parallel MLP-Attention Architectures, and E-Branchformer

Tutorials

[Olewave's Review] Branchformer: 並列MLP-Attentionアーキテクチャ、およびE-Branchformer

Conformerは長年にわたってASRエンコーダーの基準でしたが、BranchformerとそのフォローアップE-Branchformerは、逐次的なconv-plus-attentionが唯一のパスではないという説得力のあるケースを示しています。

Conformerは長年にわたってASRエンコーダーの基準でしたが、BranchformerとそのフォローアップE-Branchformerは、逐次的なconv-plus-attentionが唯一のパスではないという説得力のあるケースを示しています。このレビューは両論文を連続でカバーしています:Branchformerの並列2ブランチ設計(グローバルコンテキストのための自己注意、ローカル依存性のためのcgMLP)とE-Branchformerの強化されたマージ戦略は、LibriSpeechのtest-cleanおよびtest-otherのWERを外部データなしで1.81%および3.65%に到達させています。

このウォークスルーは、ローカルおよびグローバルモデリングを並列化することで解釈可能性の利点(マージング重みは各層がこの2つのバランスをどのように取るかを文字通り示しています)、単一の訓練済みモデルからの可変推論複雑性、およびConformerに対する同等またはより良い精度が得られる理由を詳しく説明しています。13:40で指摘されたエラッタに注意してください:これはResNet接続ではなくゲーティング操作です。E-Branchformerはこれを基に、2つのブランチがどのように融合されるかを改善し、余分なポイントワイズモジュールをスタックして、最先端のLibriSpeech WERを実現しています。次のASRまたはSLUシステムのエンコーダーを選択している場合、またはConformer以降Transformerファミリーの音声モデルがどこに向かっているかを理解しようとしているだけの場合、このサイドバイサイドは1回のセッションで5つのモデルカード相当の価値のある文脈です。