[Long Review] Wav2Seq: Pre-training Speech-to-Text Encoder-Decoder Models Using Pseudo Languages

Tutorials

[مراجعة طويلة] Wav2Seq: نماذج مشفر-فاك مدرب مسبقاً للكلام إلى نص باستخدام لغات وهمية

ركزت معظم طرق التدريب المسبق للكلام على جانب المشفر، wav2vec و HuBERT و WavLM، لكن ASR من تسلسل إلى تسلسل يحتاج أيضاً إلى فاك مدرب مسبقاً.

ركزت معظم طرق التدريب المسبق للكلام على جانب المشفر، wav2vec و HuBERT و WavLM، لكن ASR من تسلسل إلى تسلسل يحتاج أيضاً إلى فاك مدرب مسبقاً. يغلق Wav2Seq هذه الفجوة بخدعة ذكية: تجميع تمثيلات الكلام في رموز وهمية منفصلة، ثم معاملة تلك الرموز كـ "لغة وهمية" اصطناعية والتدريب المسبق لـ Transformer مشفر-فاك كامل لترجمة الكلام إليها.

تشرح هذه المراجعة الطويلة خط أنابيب Wav2Seq بالتفصيل: كيفية بناء اللغة الوهمية، لماذا يعلم اعتبارها كهدف ترجمة حقيقي الفاك شيئاً مفيداً، وكيف ينتقل النموذج المدرب مسبقاً إلى مهام ASR اللاحقة وفهم اللغة المنطوقة. يتم تضمين تصحيح حول الانتباه في وحدة seq2seq. إذا كنت تعمل على ASR محدود الموارد أو كلام إلى نص متسلسل أو تحاول الحصول على المزيد من التدريب المسبق غير الخاضع للإشراف بعيداً عن المشفر، تشرح المراجعة المتعمقة كل خيار تصميم يستحق الفهم.