[Long Review] Towards Zero-Label Language Learning

Tutorials

[Long Review] نحو التعلم اللغوي بدون تسميات

ماذا لو كان بإمكانك تدريب نماذج NLP خاصة بمهام محددة دون مثال واحد مسمى من قبل البشر؟ "نحو التعلم اللغوي بدون تسميات" يركز بشدة على هذا السؤال.

ماذا لو كان بإمكانك تدريب نماذج NLP خاصة بمهام محددة دون مثال واحد مسمى من قبل البشر؟ "نحو التعلم اللغوي بدون تسميات" يركز بشدة على هذا السؤال. الحيلة هي توليد البيانات غير الموجهة (UDG)، التي تستخدم عدد قليل من المطالبات على نموذج لغة مدرب مسبقاً كبير مثل GPT-3 لتوليف مجموعة التدريب الخاصة به، ثم يقوم بضبط دقيق لنموذج المصب بشكل حصري على تلك البيانات الاصطناعية.

تستعرض هذه المراجعة الطويلة خط أنابيب UDG بالتفصيل ونتائجها المدهشة: النماذج المدربة فقط على بيانات اصطناعية تطابق أو تتفوق على المعايير المرجعية المدربة على تعليقات توضيحية بشرية حقيقية، وعندما تمزج البيانات الاصطناعية مع البيانات المسماة كتعزيز، يحقق هذا النهج نتائج جديدة متقدمة جداً على SuperGLUE. بالنسبة لفرق الكلام والذكاء الصوتي، الآثار مباشرة - هذه هي الخطة لبناء التسميات لتصنيف النوايا والتحليل الدلالي وأي مهمة NLU في المصب حيث يكون التعليق البشري هو العنق الضيق. يستعرض هذا الغوص العميق كل جزء إذا كنت تخطط لخط أنابيب البيانات الاصطناعية التالي.