[Long Review] 'GShard': Scaling Giant Models with Conditional Computation and Automatic Sharding

Tutorials

[مراجعة طويلة] 'GShard': توسيع النماذج الضخمة باستخدام الحساب الشرطي والتقسيم التلقائي

يصبح توسيع Transformer بعد مائة مليار معامل فلسفياً بسرعة: هل تقوم بتنشيط الشبكة بأكملها لكل رمز، أم توجه كل رمز إلى المتخصصين الذين يحتاجون فعلاً إلى رؤيته؟

يصبح توسيع Transformer بعد مائة مليار معامل فلسفياً بسرعة: هل تقوم بتنشيط الشبكة بأكملها لكل رمز، أم توجه كل رمز إلى المتخصصين الذين يحتاجون فعلاً إلى رؤيته؟ GShard هو الإجابة البارزة من Google، حيث يجمع بين طبقات Mixture-of-Experts المتفرقة ونظام تعليقات الترجمة التلقائية الذي يسمح لمترجم XLA الفردي متعدد البيانات بوضع نموذج ترجمة متعدد اللغات بمعامل 600 مليار عبر آلاف نوى TPU.

تعمل هذه المراجعة الطويلة من خلال قرار البوابة top-2، وخسائر موازنة الحمل المساعدة، والتوازي المدفوع بالتعليقات التي تجعل GShard يعمل، بالإضافة إلى مكاسب جودة الترجمة التي تضع معماريات MoE على خريطة طريق الصناعة. بالنسبة لفرق الذكاء الاصطناعي الصوتي التي تنظر إلى نماذج MoE لأساس الكلام أو ASR المتعدد اللغات الذي يتوسع بدون زيادة خطية في الحساب، GShard هي الورقة التي وضعت المفردات التي استعارتها لاحقاً Switch Transformer و GLaM والعمل الحديث على المعالجة الصوتية MoE. قم بحجز ساعة واحدة إذا كان التوسيع المتفرق موجوداً في أي مكان في مستقبل معمارك.