Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognition

Tutorials

استكشاف ضبط Wav2vec 2.0 الدقيق لتحسين التعرف على المشاعر الكلامية

لطالما كان التعرف على المشاعر الكلامية عالقاً مع مجموعات بيانات صغيرة مُحددة والميزات الصوتية المصنوعة يدويّاً.

لطالما كان التعرف على المشاعر الكلامية عالقاً مع مجموعات بيانات صغيرة مُحددة والميزات الصوتية المصنوعة يدويّاً. تطرح هذه الورقة سؤالاً عملياً: هل يمكن لمرمّز wav2vec 2.0 المدرب مسبقاً على صوت غير مُحدد أن يهزم فعلاً تلك خطوط الأنابيب على IEMOCAP، وإن كان الأمر كذلك، أي وصفة ضبط دقيق تفوز؟ يقوم المؤلفون بمسح دقيق على الضبط الدقيق الجزئي مقابل الكامل، واستراتيجيات التجميع، وكم من مكدس المحول يمكن فك تجميده.

الإجابة، كما هو متوقع، هي نعم — يساعد التدريب المسبق كثيراً — لكن الأجزاء المثيرة للاهتمام موجودة في التفاصيل: أي الطبقات تحمل معلومات تمييز المشاعر، عندما يؤذي التجميد، وكيف يمكن لمجموعة صغيرة مُحددة أن تدفع نموذج 300M معامل نحو خطوط أساسية متخصصة قوية. يغطي الشرح إعداد التدريب والانقطاعات التي تهم والدروس المستفادة لأي شخص يكيّف نموذج SSL للأغراض العامة مع مهمة الحوسبة العاطفية. إذا كنت تبني أي شيء من أداة تحليل مركز الاتصالات إلى مساعد صوت يقرأ مزاج المستخدم، فإن حيل الضبط الدقيق هنا تنتقل مباشرة.