[Olewave's Review] CLIP (2/3): تعلم النماذج البصرية القابلة للنقل من الإشراف باللغة الطبيعية
قلبت CLIP من OpenAI مسار الرؤية الحاسوبية بالتخلص من مجموعات التسميات الثابتة والتدريب بدلاً من ذلك على 400 مليون زوج (صور، نصوص) مكشوطة من الإنترنت.
قلبت CLIP من OpenAI مسار الرؤية الحاسوبية بالتخلص من مجموعات التسميات الثابتة والتدريب بدلاً من ذلك على 400 مليون زوج (صور، نصوص) مكشوطة من الإنترنت. يتعمق الجزء 2 من هذا الاستعراض ثلاثي الأجزاء في الآليات التي تجعل ما قبل التدريب المقابل للصور والنصوص يعمل، وسبب أن مطابقة التسمية التوضيحية بالصورة تتحول إلى طريق فعال بشكل مذهل نحو تمثيلات بصرية SOTA. لأي شخص يبني أنظمة متعددة الطرائق حيث يشارك الكلام والنص والرؤية الآن في فضاء موحد، الدروس التصميمية هنا تتردد مباشرة في عالم الصوت (فكّر CLAP لاسترجاع الصوت والنصوص، الإشراف الضعيف بأسلوب Whisper، وعمل محاذاة الكلام-LLM التي تهبط الآن على ICASSP و Interspeech).
يمر هذا الإصدار عبر كيفية نقل CLIP بدون أمثلة إلى 30+ معايير في المصب (OCR، التعرف على الإجراءات، تحديد الموقع الجغرافي، التصنيف الدقيق) ويصل إلى دقة ResNet-50-on-ImageNet بدون لمس صور التدريب البالغة 1.28M. يؤطر النقاش سبب مقياس الإشراف باللغة الطبيعية حيث تتوقف التسميات المنسقة، وكيفية إعادة تشكيل هذا المبدأ نفسه كيف يتم ما قبل تدريب نماذج الأساس عبر الطرائق. إذا كنت تفكر في ما قبل التدريب الضعيف الإشراف لـ ASR أو TTS، فهذا هو الفصل الأوسط حيث يهبط العائد، لذا ضعه في قائمة انتظارك عندما يكون لديك عشرين دقيقة من التركيز الكامل.
