قوانين التوسع لنماذج اللغة العصبية
قبل أن يجعل GPT-3 التوسع يبدو حتمياً، جعلت هذه الورقة البحثية من OpenAI التنبؤ به ممكناً.
قبل أن يجعل GPT-3 التوسع يبدو حتمياً، جعلت هذه الورقة من OpenAI التنبؤ به ممكناً. أجرى Kaplan والمؤلفون المشاركون مئات من عمليات التدريب عبر أحجام النماذج وأحجام مجموعات البيانات وميزانيات الحوسبة، واكتشفوا أن خسارة نموذج اللغة تتبع قوانين طاقية نظيفة على امتداد سبع رتب ضخمة. غيرت الآثار المترتبة على ذلك المجال بشكل جذري: مع ميزانية حوسبة محددة، هناك حجم نموذج وعدد رموز مثلى، وهو في الغالب ليس ما كان يفترضه الممارسون.
يتناول الشرح الكميات الثلاث المسيطرة، ولماذا تقل أهمية تفاصيل المعمارية عما قد تتوقع، وكيف أدى حد الحوسبة المثلى للورقة إلى توجيه كل شيء من GPT-3 إلى Chinchilla إلى نماذج الكلام الأساسية الحديثة. هناك أيضاً ملاحظة حول خطأ لفت انتباه المقدم إليه في ديناميكيات حجم الدفعة — يستحق الاستماع إليه إذا كنت تهتم بإعداد التجربة. إذا اضطررت يوماً ما إلى تبرير ميزانية التدريب أو شرح لصاحب مصلحة لماذا الحجم الأكبر أفضل حقاً هنا، فهذه قراءة أساسية توفر عليك الكثير من الكلام الفارغ. استمع إليه.
