WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing

Tutorials

WavLM: التدريب المسبق ذاتي الإشراف على نطاق واسع لمعالجة الكلام الشاملة

معظم نماذج SSL للكلام تحسّن من أجل ASR وتأمل أن ينجح كل شيء آخر.

معظم نماذج SSL للكلام تحسّن من أجل ASR وتأمل أن ينجح كل شيء آخر. WavLM، من Microsoft، مبني بطريقة مختلفة — تدريب مسبق واحد، والقيام بكل شيء: التعرف، والتحقق من المتحدث، وتحديد المتحدثين، وفصل الكلام، ومعيار SUPERB الكامل. المفتاح هو انحياز موضع نسبي مُتحكّم به في Transformer بالإضافة إلى مزج الكلام أثناء التدريب المسبق، مما يفرض على النموذج تعلم تمثيلات مدركة للمتحدث وقوية ضد الضوضاء بدلاً من مجرد تمثيلات صوتية.

كانت النتيجة فوزاً شاملاً بجدول ترتيب SUPERB عند إصداره، مع تحسنات قوية جداً في مهام non-ASR التي تميل HuBERT و wav2vec 2.0 إلى الضعف فيها. تتناول هذه الجلسة كيف يبدو مزج الكلام فعلياً في وقت التدريب، ولماذا يهم انحياز الموضع في السياقات الأطول، وكيف تم تجميع مجموعة التدريب المسبق التي تبلغ 94 ألف ساعة. إذا تعبت من الحفاظ على مشفر منفصل لكل مهمة كلام، فإن WavLM هو أحد أقوى نماذج العمود الفقري الفردي المتاحة على HuggingFace اليوم — الشرح العميق يستحق الاستماع إليه.