Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognition

Tutorials

探索 wav2vec 2.0 微调以改进语音情感识别

语音情感识别长期以来一直被困于微小的标注数据集和手工制作的声学特征。

语音情感识别长期以来一直被困于微小的标注数据集和手工制作的声学特征。这篇论文提出了一个实际问题:在未标注音频上预训练的 wav2vec 2.0 编码器是否真的能在 IEMOCAP 上击败这些管道,如果可以,哪个微调方案获胜?作者对部分与完全微调、池化策略和要解冻 Transformer 堆栈的数量进行了仔细的超参数搜索。

答案不出所料是肯定的——预训练帮助很大——但有趣的细节在于:哪些层携带情感判别信息、冻结何时会造成伤害,以及一个小型标注语料库如何仍能推动一个 300M 参数的模型超越强大的专业基线。这个演练涵盖了训练设置、重要的消融,以及对任何人将通用 SSL 模型适配到情感计算任务的启示。如果你正在构建从呼叫中心分析工具到读取用户情绪的语音助手的任何东西,这里的微调技巧可以直接转移。