[Detailed Paper Reading] Zipformer: A faster and better encoder for automatic speech recognition

Tutorials

[상세 논문 읽기] Zipformer: 자동 음성 인식을 위한 더 빠르고 나은 인코더

Conformer은 수년 동안 기본 ASR 인코더였지만, k2/icefall 팀의 Zipformer은 더 빠르고 가벼우면서도 LibriSpeech, Aishell-1, WenetSpeech에서 조용히 WER 왕관을 차지했습니다.

Conformer은 수년 동안 기본 ASR 인코더였지만, k2/icefall 팀의 Zipformer은 더 빠르고 가벼우면서도 LibriSpeech, Aishell-1, WenetSpeech에서 조용히 WER 왕관을 차지했습니다. 이 상세 논문 읽기는 정확히 그들이 어떻게 해냈는지를 설명합니다: 중간 스택을 더 낮은 프레임 속도로 다운샘플링하는 U-Net 스타일 인코더, 서브 모듈에 걸쳐 주의력 가중치를 재사용하는 재구성된 블록, 길이 정보를 보존하는 BiasNorm LayerNorm 변형, 그리고 Swish를 능가하는 두 개의 새로운 활성화 함수(SwooshR 및 SwooshL)입니다.

연습은 아키텍처에서 멈추지 않습니다. Zipformer은 테너당 업데이트를 재조정하고 매개변수 스케일을 명시적으로 학습하여 동일한 레시피에서 Adam보다 빠르게 수렴하는 새로운 옵티마이저인 ScaledAdam과 함께 배포됩니다. 각 설계 선택은 그것을 정당화하는 제거 항목으로 풀어져 있으므로, 어떤 트릭이 일반화되고 어떤 트릭이 U-Net 토폴로지에 묶여 있는지 볼 수 있습니다. 프로덕션에서 ASR 인코더를 유지 관리하거나, Next-gen Kaldi가 거대한 계산 예산 없이 최첨단을 계속 설정하는 이유가 궁금하다면, 재생을 누르십시오 — 이것은 추상화가 아닌 엔지니어링에 깊이 들어가는 드문 논문 읽기입니다.