[Long Review] Fully Sharded Data Parallel: faster AI training with fewer GPUs

Tutorials

[Long Review] Fully Sharded Data Parallel: تدريب ذكاء اصطناعي أسرع مع معالجات رسوميات أقل

كان تدريب نموذج كلام أو لغة ذو مليار معامل على ميزانية GPU متواضعة يعني الاختيار بين التوازي في خط الأنابيب أو التوازي الموتري أو تجزئة المحسن من نمط ZeRO.

كان تدريب نموذج كلام أو لغة ذو مليار معامل على ميزانية GPU متواضعة يعني الاختيار بين التوازي في خط الأنابيب أو التوازي الموتري أو تجزئة المحسن من نمط ZeRO. توفر تقنية Fully Sharded Data Parallel (FSDP) من Meta، التي تم إطلاقها الآن في FairScale وتم دمجها لاحقاً في PyTorch، حلاً أبسط: تجزئة المعاملات نفسها عبر عمال التوازي بالبيانات، وجمعها عند الحاجة لكل دفعة صغيرة، وتداخل الاتصالات مع الحسابات بحيث تبقى تكلفة الوقت الفعلي منخفضة.

تشرح هذه المراجعة الطويلة لماذا FSDP أبسط من الناحية المفاهيمية من التوازي داخل الطبقة أو التوازي في خط الأنابيب، وكيف تتفوق تجزئة المعاملات الموحدة على نهج تخزين حالة المحسن والتدرجات، وكيف يتيح نقل CPU الاختياري لك تدريب نماذج أكبر. إذا كنت تدرب نماذج صوتية TTS أو نماذج أساسية من طراز wav2vec أو LLMs لمساعدات الصوت، فإن FSDP تصبح بسرعة متطلباً معيارياً للتوسع بدون مجموعة بحجم مركز البيانات. استعد للغوص العميق إذا كنت تريد فهم الآليات قبل تفعيلها في سكريبت التدريب الخاص بك.