[Long Review] Fully Sharded Data Parallel: تدريب ذكاء اصطناعي أسرع مع معالجات رسوميات أقل
كان تدريب نموذج كلام أو لغة ذو مليار معامل على ميزانية GPU متواضعة يعني الاختيار بين التوازي في خط الأنابيب أو التوازي الموتري أو تجزئة المحسن من نمط ZeRO.
[Short Review] Fully Sharded Data Parallel: تدريب ذكاء اصطناعي أسرع مع معالجات رسوميات أقل
Fully Sharded Data Parallel هي إجابة Meta على سؤال تسأله كل فريق كلام ولغة في النهاية: كيف نقوم بتدريب نماذج أكبر بكثير دون الحاجة إلى معالجات رسوميات أكثر بكث…
[مراجعة طويلة] إلغاء تكرار بيانات التدريب يجعل نماذج اللغة أفضل
يبدو إلغاء التكرار ممل حتى تتعلم أن جملة واحدة من 61 كلمة تظهر أكثر من 60,000 مرة داخل C4، وأن نماذج اللغة المدربة على مثل هذه المجموعات تعيد نص بيانات التدريب…
[مراجعة قصيرة] إلغاء تكرار بيانات التدريب يجعل نماذج اللغة أفضل
كم من "التعميم" في نموذج اللغة الخاص بك هو في الواقع مجرد إعادة إنتاج؟
[مراجعة طويلة] CLAS: السياق العميق: التعرف على الكلام السياقي من طرف إلى طرف
أي شخص أطلق منتج ASR يعرف صعوبة الأسماء العلمية: أسماء جهات الاتصال، عناوين الأغاني، أسماء الأدوية، أسماء الأماكن الغامضة.
[مراجعة طويلة] العقبات في التقدم في الإجابة على الأسئلة الطويلة
الإجابة على الأسئلة الطويلة هي أحد تلك المعايير التي تبدو مثيرة للإعجاب على لوحة التصنيف ومقلقة تحت المجهر.
