[Olewave's Review] Branchformer: Parallel MLP-Attention Architectures, and E-Branchformer

Tutorials

[Olewave的評論] Branchformer:並行MLP-注意力架構和E-Branchformer

多年來,Conformer一直是最難超越的ASR編碼器,但Branchformer及其後續作品E-Branchformer令人信服地表明,順序卷積加注意力並不是唯一的路徑。

多年來,Conformer一直是最難超越的ASR編碼器,但Branchformer及其後續作品E-Branchformer令人信服地表明,順序卷積加注意力並不是唯一的路徑。本評論連續涵蓋兩篇論文:Branchformer的並行雙分支設計(自注意力用於全局上下文,cgMLP用於局部依賴性)和E-Branchformer的增強合併策略,將LibriSpeech test-clean和test-other WERs達到1.81%和3.65%,無需外部數據。

本演練說明瞭並行化局部和全局建模的優勢:可解釋性收益(合併權重直接告訴您每一層如何平衡兩者),單個訓練模型的可變推理複雜性,以及相比Conformer更好或相當的準確性。注意13:40處指出的勘誤:這是一個門控操作,而非ResNet連接。E-Branchformer通過改進兩個分支的融合方式並堆積額外的逐點模塊來進一步改進,以達到那些最先進的LibriSpeech WERs。如果您正在為下一個ASR或SLU系統選擇編碼器,或想了解Transformer系列語音模型在Conformer之後如何發展,這種並排對比值得一看,提供了相當於五張模型卡片的紮實內容。