هل يتم تسجيل 4 Flip الخاص بـ Nathan Chen بواسطة Mixture-of-Experts؟ الجزء 1: Switch Transformers: نماذج MoE المتفرقة
تم تأطيره برمزة إلى Nathan Chen's quad flip scoring، تتناول هذه المحادثة Switch Transformer، تفسير Google النظيف والمبسط بعدوانية لتوسيع Mixture-of-Experts.
تم تأطيره برمزة إلى Nathan Chen's quad flip scoring، تتناول هذه المحادثة Switch Transformer، تفسير Google النظيف والمبسط بعدوانية لتوسيع Mixture-of-Experts. حيث صممت تصاميم MoE السابقة توجيه كل رمز إلى متخصصين، يوجه Switch إلى واحد فقط، مما يقلل رياضيات التوجيه إلى الحد الأدنى ويفتح تشغيلات التدريب بمعامل تريليون تبقى مستقرة على نوى TPU الحقيقية.
الجزء الأول من سلسلة من جزأين، تستعرض هذه المراجعة قرار البوابة top-1، وخسائر موازنة الحمل وحيل عامل السعة التي تمنع المتخصصين من الجوع أو الامتلاء، وتسريعات التدريب المسبق التي يوفرها Switch على خطوط أساس T5 الكثيفة. بالنسبة لفرق الذكاء الاصطناعي الصوتي التي تنظر في معماريات متفرقة لنماذج كلام LLM أو ASR متعدد اللغات أو محاور TTS متعددة المجالات، Switch Transformer هي الورقة التي جعلت النماذج بمعاملات تريليون تبدو قابلة للتحقيق وليست طموحة فقط. قم بسحبها إذا كنت تريد البديهة قبل أن تغوص في GLaM في الجزء 2.
