Google Researcher's In-Depth Analysis on End-to-End Speech Recognition, Part 1: Overview & Modeling

Tutorials

تحليل الباحث من Google المتعمق حول الكلام من طرف إلى طرف، الجزء 1: النظرة العامة والنمذجة

قلل عقد من التعلم العميق معدلات أخطاء كلمات ASR بأكثر من 50 في المئة نسبة، وفي هذه العملية، جعل خطوط أنابيب HMM الكلاسيكية تبدو مثل التراث.

قلل عقد من التعلم العميق معدلات أخطاء كلمات ASR بأكثر من 50 في المئة نسبة، وفي هذه العملية، جعل خطوط أنابيب HMM الكلاسيكية تبدو مثل التراث. يقدم تفصيل الجزء الأول لمسح E2E ASR من Prabhavalkar و Hori و Sainath و Schluter و Watanabe (التشكيل الذي يشكل فعلاً المجال) تصنيف نماذج E2E ASR ويجليها ضد تراث HMM الذي نشأ عليه معظم المهندسين العاملين. إنها حلقة الإطار التي تجعل بقية المسح ينقر في المكان.

تركز النظرة العامة على النمذجة — كيف تختلف CTC وأجهزة فك التشفير القائمة على الانتباه وعديلات transducer من حيث الانحياز الحثي، وما الذي تجلبه لك من حيث تقليل الاعتماد على خبرة المجال الخاصة بـ ASR، ولماذا اندمجت الصناعة حول كل المكدسات العصبية التي تتعلم بشكل أكثر اتساقاً من البيانات. تحدد المرحلة للأجزاء اللاحقة حول التدريب، فك الترميز، دمج نموذج اللغة الخارجي، النشر، تحليل الأداء، والاتجاهات المستقبلية للمجال. إذا كنت تتعطل فوق فريق ASR حديث أو تحاول الاختيار بين هجينات نمط Kaldi وشيء مثل Whisper أو NeMo أو ESPnet أو معرف transducer قائم، فهذه هي الخريطة التي تريدها قبل المشي في التضاريس.