[Olewave's Long Review] Efficient Training of Neural Transducer for Speech Recognition

Tutorials

[مراجعة Olewave الطويلة] التدريب الفعّال لـ Neural Transducer للتعرف على الكلام

محولات Neural هي حصان العمل في ASR للبث، لكن تدريبها بكفاءة مشهور بأنه مؤلم: خسارة RNN-T لديها ذاكرة مكعبة في طول التسلسل، وشبكة المحاذاة تنفجر على الكلام الطويل، والفردي-

محولات Neural هي حصان العمل في ASR للبث، لكن تدريبها بكفاءة مشهور بأنه مؤلم: خسارة RNN-T لديها ذاكرة مكعبة في طول التسلسل، وشبكة المحاذاة تنفجر على الكلام الطويل، وتجارب GPU واحدة تتباطأ للتوقف. تعالج هذه المراجعة الطويلة Efficient Training of Neural Transducer for Speech Recognition، وتكشف عن الخيارات الهندسية التي تجعل تدريب transducer قابلاً للتطبيق دون التضحية بدقة التعرف، وسبب أهمية الورقة لأي شخص لا يزال يكافح OOMs على مكدس قام فريق آخر بترويضه بالفعل.

توقع جولة شاملة عبر حيل حساب الخسارة وتحسينات الذاكرة واستراتيجيات تقييد المحاذاة وجداول التدريب التي تسمح للفرق بتعديل RNN-T بما يتجاوز نظام toy-benchmark إلى الإنتاج. تربط المراجعة الخيارات الخوارزمية بسبب أهميتها على الأجهزة الحقيقية، وأين المقارنات بين الإنتاجية وذاكرة GPU و WER النهائية تعض فعلاً. إذا كنت تقوم بتصحيح أخطاء OOM على تدريب transducer، أو تزن ما إذا كان يجب الاستثمار في مكدس transducer مقابل CTC أو encoder-decoders قائم على الانتباه، أو محاولة فهم سبب كون تدريب RNN-T الفعّال موضوعًا متكررًا في Interspeech و ICASSP، فإن هذه المراجعة هي نوع الغوص العميق الذي يوفر لك أسبوعًا من ألم التنفيذ. استعدّ لها قبل sprint transducer التالي.