Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognition

Tutorials

음성 감정 인식 개선을 위한 Wav2vec 2.0 미세 조정 탐색

음성 감정 인식은 오랫동안 작은 레이블된 데이터셋과 손으로 만든 음향 특성에 갇혀 있었습니다.

음성 감정 인식은 오랫동안 작은 레이블된 데이터셋과 손으로 만든 음향 특성에 갇혀 있었습니다. 이 논문은 실질적인 질문을 제시합니다: IEMOCAP에서 사전 훈련된 wav2vec 2.0 인코더가 실제로 이러한 파이프라인을 능가할 수 있으며, 그렇다면 어느 미세 조정 레시피가 승리할까요? 저자들은 부분 대 전체 미세 조정, 풀링 전략, 그리고 트랜스포머 스택의 얼마나 많은 부분을 언프리징할지에 대한 신중한 탐색을 실행합니다.

답은 예상대로 그렇다입니다 — 사전 훈련이 많은 도움이 됩니다 — 하지만 흥미로운 부분은 세부 사항에 있습니다: 어느 레이어가 감정 판별 정보를 포함하는지, 언제 동결이 해를 끼치는지, 그리고 작은 레이블된 말뭉치가 여전히 300M 매개변수 모델을 강한 특화된 기준선을 넘을 수 있는 방법. 이 안내는 훈련 설정, 중요한 절제, 그리고 범용 SSL 모델을 감정 컴퓨팅 작업에 적응시키는 모든 사람을 위한 핵심 사항을 다룹니다. 콜센터 분석 도구에서 사용자의 기분을 읽는 음성 보조자에 이르기까지 무엇이든 만들고 있다면, 여기서 미세 조정 트릭이 직접 이전됩니다.