[Long Review] Axial Attention in Multidimensional Transformers

Tutorials

[Long Review] الانتباه المحوري في المحولات متعددة الأبعاد

الانتباه الذاتي الكامل على صورة أو فيديو مكلف للغاية، فكيف تحافظ على التعبيرية للمحول بدون الانفجار التربيعي؟

الانتباه الذاتي الكامل على صورة أو فيديو مكلف للغاية، فكيف تحافظ على التعبيرية للمحول بدون الانفجار التربيعي؟ يقترح Ho و Kalchbrenner و Weissenborn و Salimans الانتباه المحوري: الانتباه فقط على طول محور واحد من الموتر في المرة الواحدة، وتكديس المحاور، وتستعيد السياق الكامل بجزء صغير من الحساب.

يمر هذا الاستعراض الطويل لورقة المحولات المحورية من خلال العمارة من البداية إلى النهاية، وكيفية تكوين طبقات الانتباه المحوري، ولماذا هيكل فك التشفير شبه الموازي يعمل فعلاً بدون افتراضات الاستقلال، وكيف يحقق النموذج نتائج متقدمة على ImageNet-32 و ImageNet-64 و BAIR Robotic Pushing. يجب أن ينتبه مهندسو الكلام: تنطبق نفس الحيلة على أي موتر عالي الأبعاد، بما في ذلك شبكات الطيف-الوقت-التردد، والورقة مفتوحة المصدر. يمر الغوص العميق عبر كل خيار تصميم إذا كنت تفكر في الانتباه الفعال للصوت أو العمل متعدد الأنماط.