[Detailed Paper Reading] Zipformer: A faster and better encoder for automatic speech recognition

Tutorials

[قراءة ورقة مفصلة] Zipformer: ترميز أسرع وأفضل للتعرف التلقائي على الكلام

لقد كان Conformer هو ترميز ASR الافتراضي لسنوات، لكن Zipformer من فريق k2/icefall أخذ بهدوء تاج WER على LibriSpeech و Aishell-1 و WenetSpeech بينما يكون أسرع وأخف.

لقد كان Conformer هو ترميز ASR الافتراضي لسنوات، لكن Zipformer من فريق k2/icefall أخذ بهدوء تاج WER على LibriSpeech و Aishell-1 و WenetSpeech بينما يكون أسرع وأخف. تمر هذه قراءة الورقة المفصلة بالضبط كيف فعلوا ذلك: ترميز على طراز U-Net ينزل من العينات المكدسة الوسطى إلى معدلات الإطار الأقل، كتلة معاد تنظيمها تعيد استخدام أوزان الاهتمام عبر الوحدات الفرعية، متغير BiasNorm من LayerNorm الذي يحافظ على معلومات الطول، ودالتان تفعيليتان جديدتان (SwooshR و SwooshL) التي تتفوق على Swish.

لا يتوقف الشرح عند البنية المعمارية. يأتي Zipformer مع ScaledAdam، محسّن جديد يعيد تحجيم التحديثات لكل موتر ويتعلم مقياس المعاملة بشكل صريح، متقاربة أسرع من Adam على نفس الوصفات. يتم فك كل اختيار تصميم مع الدراسات الاستئصالية التي تبرره، بحيث يمكنك رؤية الحيل التي تعمم والحيل المرتبطة بـ U-Net topology. إذا كنت تحافظ على ترميز ASR في الإنتاج، أو فضولي بشأن السبب في أن Next-gen Kaldi يستمر في تعيين أحدث حالة بدون ميزانية حسابية ضخمة، اضغط على التشغيل — هذه قراءة ورقة نادرة تتعمق في الهندسة، وليس فقط الملخص.