HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units

Tutorials

HuBERT: 숨겨진 단위의 마스킹 예측을 통한 자체 지도 음성 표현 학습

wav2vec 2.0이 대조적 자체 지도로 게임을 바꿨지만, HuBERT는 더 날카로운 질문을 제시했습니다: 대조적 트릭을 완전히 건너뛰고 음성에서 BERT 스타일의 마스킹 예측을 수행하면 어떨까요?

wav2vec 2.0이 대조적 자체 지도로 게임을 바꿨지만, HuBERT는 더 날카로운 질문을 제시했습니다: 대조적 트릭을 완전히 건너뛰고 음성에서 BERT 스타일의 마스킹 예측을 수행하면 어떨까요? 문제는 오디오에는 자연 어휘가 없다는 것입니다. 따라서 HuBERT는 자체적으로 부트스트랩합니다 — 먼저 MFCCs를 클러스터링한 다음 모델 자신의 숨겨진 상태를 반복적으로 재클러스터링합니다 — 그리고 트랜스포머를 훈련하여 마스킹된 프레임에서 그러한 의사 레이블을 예측합니다.

그 효과는 더 명확한 목표이며, Librispeech와 Libri-light에서 Base에서 X-Large까지의 모든 모델 규모에서 wav2vec 2.0과 일치하거나 이를 능가하는 결과입니다. Meta AI의 이 심층 분석은 k-means 부트스트래핑 루프, 반복을 통해 음향 단위가 나타나는 이유, 그리고 동일한 사전 학습이 ASR, 화자 ID 및 감정 작업으로 어떻게 효과적으로 전이되는지를 다룹니다. HuBERT는 이후 음성 표현 작업을 수행하는 누구든지를 위한 HuggingFace의 기본 시작점 중 하나가 되었습니다. 따라서 다음 ASR 또는 SLU 프로젝트를 위해 인코더를 선택하고 있다면, 여기서 직관을 이해하는 데 몇 분을 투자하면 나중에 하이퍼파라미터 튜닝에서 여러 시간을 절약할 수 있습니다.