Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognition

Tutorials

探索 Wav2vec 2.0 微調以改進語音情感識別

語音情感識別長期以來一直受困於微小的標記數據集和手工製作的聲學特徵。

語音情感識別長期以來一直受困於微小的標記數據集和手工製作的聲學特徵。本文提出了一個實踐問題:在未標記音頻上預訓練的 wav2vec 2.0 編碼器是否真的能在 IEMOCAP 上擊敗這些管道,如果是,哪個微調食譜會贏?作者們對部分微調與完整微調、池化策略和要解凍多少 Transformer 堆棧進行了仔細的掃描。

答案毫不奇怪是肯定的——預訓練幫助很大——但有趣的地方在於細節:哪些層承載情感區別信息、凍結何時會傷害,以及小標記語料庫如何仍然能推動 300M 參數的模型超越強大的專業基線。這個演練涵蓋了訓練設置、重要的消融,以及任何人適應通用 SSL 模型到情感計算任務的收獲。如果您構建任何東西,從呼叫中心分析工具到讀取用戶心情的語音助手,這裡的微調技巧直接轉移。