W2v-BERT: دمج التعلم التباعدي والنمذجة اللغوية المقنعة للإشراف الذاتي
لماذا تختار بين التعلم التباعدي والنمذجة اللغوية المقنعة للتدريب المسبق للكلام عندما يمكنك ربط كليهما في نفس الشبكة؟
لماذا تختار بين التعلم التباعدي والنمذجة اللغوية المقنعة للتدريب المسبق للكلام عندما يمكنك ربط كليهما في نفس الشبكة؟ W2v-BERT، من Google، يكدس وحدة تباعدية بأسلوب wav2vec فوق وحدة MLM بأسلوب BERT ويدربهما بشكل نهائي، لذا فإن دفتر الرموز المنفصل الذي تعلمه فقدان التباعد يصبح هدف التنبؤ لرأس MLM — بدون تجميع غير متصل، بدون خط أنابيب على مرحلتين.
اتضح أن تصميم الحلقة الواحدة هذا أكثر من مجرد خيار هندسي نظيف. على Librispeech test-other، يحقق W2v-BERT WER منخفضة جديدة وقت النشر ويعمم بنظافة على بيانات بحث الصوت متعددة اللغات الضخمة من Google، محققاً أداء أفضل من wav2vec 2.0 و HuBERT عند حسابات معاملات مقارنة. تحلل الحديث شروط الخسارة الاثنان، لماذا يثبت التدريب المشترك استخدام دفتر الرموز، وأين لا يزال النموذج يترك مجالاً للضبط الدقيق النهائي. إذا كنت تقيّم أي العمود الفقري الموجه ذاتياً لبناء ASR الإنتاج الخاص بك، فإن هذا يستحق 10 دقائق من انتباهك.
