[Olewave's Review] CLIP (3/3): تعلم النماذج البصرية القابلة للنقل من الإشراف باللغة الطبيعية
يقع الجزء الأخير من هذا الاستعراض CLIP في قسم النتائج، وهو حيث حول نموذج OpenAI المقابل للصور والنصوص من فكرة مثيرة للاهتمام إلى عنصر بدائي على مستوى الأساس لمجموع المكدس متعدد الطرائق.
الجزء الأخير من هذا الاستعراض CLIP يصل إلى قسم النتائج، وهو حيث حول نموذج OpenAI المقابل للصور والنصوص من فكرة مثيرة للاهتمام إلى عنصر بدائي على مستوى الأساس لمجموع المكدس متعدد الطرائق. تم التدريب على 400 مليون زوج صور-نصوص تم كشطها من الويب، CLIP يتعلم مطابقة التسميات التوضيحية بالصور، والهدف البسيط هذا يتحول إلى تمكين النقل بدون أمثلة عبر أكثر من 30 معيار رؤية حاسوبية في المصب بما في ذلك OCR والتعرف على الإجراءات وتحديد الموقع الجغرافي والتصنيف الدقيق.
يتعمق الشرح المفصل في معايير الصفحة الأولى، بما في ذلك مطابقة ResNet-50 المشرف بالكامل على ImageNet بدون أمثلة ImageNet موسومة، والعديد من الأماكن التي يعمم CLIP فيها وحيث لا يعمم. لمتخصصي الذكاء الصوتي، الدرس القابل للنقل هو وصفة CLIP-style المقابلة لما قبل التدريب التي تدعم الآن CLAP لاسترجاع الصوت والنصوص، التدريب متعدد المهام بأسلوب Whisper، والمساحات الموحدة المشتركة التي تشغل مساعدين متعددي الطرائق. أنهِ السلسلة ثلاثية الأجزاء بالأرقام التي أقنعت المجال أن الإشراف باللغة الطبيعية هو الطريق الصحيح. يستحق وقتك إذا كنت تتعامل مع الاسترجاع أو الوسم أو أي نظام متعدد الطرائق.
