[مراجعة Olewave] Branchformer: معماريات MLP-Attention المتوازية، و E-Branchformer
كان Conformer هو مشفر ASR الذي يجب التغلب عليه لسنوات، لكن Branchformer و تابعه E-Branchformer يقدمان حالة مقنعة بأن sequential conv-plus-attention ليس هو المسار الوحيد.
كان Conformer هو مشفر ASR الذي يجب التغلب عليه لسنوات، لكن Branchformer و تابعه E-Branchformer يقدمان حالة مقنعة بأن sequential conv-plus-attention ليس هو المسار الوحيد. تغطي هذه المراجعة كلا الورقتين معاً: التصميم المتوازي بفرعين من Branchformer (self-attention للسياق العام، cgMLP للتبعيات المحلية) واستراتيجية الدمج المحسّنة من E-Branchformer التي تدفع WERs في LibriSpeech test-clean و test-other إلى 1.81٪ و 3.65٪ بدون بيانات خارجية.
يشرح هذا الحل لماذا يؤدي توازي النمذجة المحلية والعامة إلى مميزات قابلية التفسير (أوزان الدمج تخبرك حرفياً كيف يوازن كل طبقة بين الاثنين)، وتعقيد الاستدلال المتغير من نموذج واحد مدرّب، ودقة أفضل أو متطابقة مع Conformer. لاحظ التصحيح المشار إليه في 13:40: إنها عملية gating وليست اتصال ResNet. يبني E-Branchformer على ذلك بتحسين كيفية دمج الفرعين وتكديس وحدات point-wise إضافية لاستخراج WERs الرائدة من LibriSpeech. إذا كنت تختار مشفر ASR أو نظام SLU التالي، أو تحاول فقط فهم أين توجه نماذج الكلام من عائلة Transformer بعد Conformer، فإن هذا العرض جنباً إلى جنب يقدم سياقاً قوياً بقيمة خمس أوراق بحثية في جلسة واحدة.
