WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing

Tutorials

WavLM: 전체 스택 음성 처리를 위한 대규모 자가 감독 사전 학습

대부분의 음성 SSL 모델은 ASR에 최적화되고 다른 모든 것이 잘 작동하기를 바랍니다.

대부분의 음성 SSL 모델은 ASR에 최적화되고 다른 모든 것이 작동하기를 바랍니다. Microsoft의 WavLM은 반대로 구축되었습니다 — 한 번 사전 학습하고 모든 것을 수행합니다: 인식, 화자 검증, 화자 분리, 음성 분리, 전체 SUPERB 벤치마크. 핵심은 Transformer의 게이트된 상대 위치 편향과 사전 학습 중 발화 혼합이며, 이는 모델이 음성학적 표현뿐만 아니라 화자 인식 및 노이즈 견고 표현을 학습하도록 강제합니다.

그 결과는 출시 당시 SUPERB 리더보드의 완전한 석권이었으며, 특히 HuBERT와 wav2vec 2.0이 대부분 충족하지 못하는 비-ASR 작업에서 특히 강한 성과를 거두었습니다. 이 세션은 학습 시간에 발화 혼합이 실제로 어떤 모습인지, 더 긴 컨텍스트에 대해 위치 편향이 중요한 이유, 그리고 94,000시간의 사전 학습 코퍼스가 어떻게 구성되었는지를 설명합니다. 매 다운스트림 음성 작업마다 별도의 인코더를 유지하는 것에 지쳤다면, WavLM은 오늘날 HuggingFace에서 사용할 수 있는 가장 강력한 단일 백본 선택지 중 하나입니다 — 상세 분석은 충분히 볼 가치가 있습니다.