W2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self Supervise

Tutorials

W2v-BERT: 대조 학습과 마스킹된 언어 모델링을 결합한 자체 지도

음성 사전 학습을 위해 대조 학습과 마스킹된 언어 모델링 중에 선택해야 할 때 둘을 같은 네트워크에 연결할 수 있다면 왜 선택해야 할까요?

음성 사전 학습을 위해 대조 학습과 마스킹된 언어 모델링 중에 선택해야 할 때 둘을 같은 네트워크에 연결할 수 있다면 왜 선택해야 할까요? Google의 W2v-BERT는 wav2vec 스타일의 대조 모듈을 BERT 스타일의 MLM 모듈 위에 쌓고 끝에서 끝까지 훈련하므로, 대조 손실에 의해 학습된 이산 코드북이 MLM 헤드의 예측 대상이 됩니다 — 오프라인 클러스터링 없음, 두 단계 파이프라인 없음.

그 단일 루프 설계는 단순한 공학적 선택 이상입니다. Librispeech test-other에서 W2v-BERT는 발표 당시 새로운 낮은 WER에 도달했으며 Google의 대규모 다국어 음성 검색 데이터로 깔끔하게 일반화되어 비교 가능한 매개변수 수에서 wav2vec 2.0과 HuBERT를 능가합니다. 이 강연은 두 손실 항을, 공동 훈련이 코드북 사용을 안정화하는 이유를, 그리고 모델이 여전히 다운스트림 미세 조정을 위해 남겨둔 여유를 설명합니다. 프로덕션 ASR을 구축할 자체 지도 백본을 평가하고 있다면, 이것은 10분 주목할 가치가 있습니다.