[詳細論文閱讀] Zipformer:用於自動語音識別的更快更好的編碼器
Conformer 多年來一直是默認的 ASR 編碼器,但 k2/icefall 團隊的 Zipformer 在保持更快和更輕的同時,悄悄奪得了 LibriSpeech、Aishell-1 和 WenetSpeech 上的 WER 冠軍。
Conformer 多年來一直是默認的 ASR 編碼器,但 k2/icefall 團隊的 Zipformer 在保持更快和更輕的同時,悄悄奪得了 LibriSpeech、Aishell-1 和 WenetSpeech 上的 WER 冠軍。本詳細論文閱讀詳細介紹了他們是如何做到的:一個 U-Net 風格的編碼器,將中間堆棧下採樣到更低的幀速率,一個重新組織的塊,在子模塊中重用注意力權重,一個保留長度信息的 BiasNorm LayerNorm 變體,以及兩個新的激活函數(SwooshR 和 SwooshL),它們的性能優於 Swish。
演練並不止於架構。Zipformer 搭載了 ScaledAdam,一個新的優化器,它重新縮放每個張量的更新並顯式學習參數尺度,在相同食譜上比 Adam 收斂更快。每個設計選擇都配備了證明其合理性的消融研究,因此您可以看到哪些技巧是通用的,哪些與 U-Net 拓撲相關。如果您在生產中維護 ASR 編碼器,或者您很好奇為什麼 Next-gen Kaldi 在沒有巨大計算預算的情況下仍然設置最先進的技術,請按播放——這是一份罕見的論文閱讀,深入工程細節,而不僅僅是摘要。
