ChatGPT/ChatGPT Plus/InstructGPT: تدريب نماذج اللغة على متابعة التعليمات برد فعل بشري
خلف منتج ChatGPT تقف ورقة InstructGPT، وتفكك هذه المراجعة المفصلة خط الأنابيب الذي حول GPT-3 الخام إلى شيء يريد الناس فعلاً التحدث معه.
خلف منتج ChatGPT تقف ورقة InstructGPT، وتفكك هذه المراجعة المفصلة خط الأنابيب الذي حول GPT-3 الخام إلى شيء يريد الناس فعلاً التحدث معه. تتكون الوصفة من ثلاث مراحل: الضبط الدقيق الخاضع للإشراف على عروض عاملة السلوك المرغوب، ونموذج مكافأة مدرب على تصنيفات بشرية للمخرجات، والتعلم المعزز من ردود الفعل البشرية التي تدفع النموذج الأساسي نحو المكافأة. RLHF هو الاختصار الذي استهلك الصناعة، وهنا كسب احترامه.
النتيجة الرئيسية لا تزال تفاجئ الناس: نموذج InstructGPT بحجم 1.3B أنتج مخرجات فضلها الناس على GPT-3 بحجم 175B، مع صدقية أفضل وأقل سمية وانحدار ضئيل جداً على معايير NLP العامة. بالنسبة لفرق voice-AI التي تفكر في محاذاة speech LLMs وتحكم نمط TTS أو وكلاء حوارية بنية المستخدم، فإن خريطة المحاذاة هنا هي الخريطة التي يبني عليها كل ورقة متابعة. يمر الغوص العميق عبر بروتوكول الوسم وحساب نموذج المكافأة والمقايضات التي تشكل أنظمة الحوار الإنتاجية اليوم. قراءة أساسية، أو في هذه الحالة، مشاهدة أساسية.
