I-JEPA: Yannn LeCun's First 'World Model' for Computer Vision

Tutorials

I-JEPA: نموذج العالم الأول من Yann LeCun لرؤية الحاسوب

Yann LeCun جادل لسنوات بأن الاستدراج التوليدي هو الرهان الخاطئ لبناء آلات تفهم العالم.

Yann LeCun جادل لسنوات بأن الاستدراج التوليدي هو الرهان الخاطئ لبناء آلات تفهم العالم. I-JEPA هو أول إصدار ملموس من Meta AI لتحويل هذه الأطروحة إلى كود لرؤية الحاسوب. بدلاً من إعادة بناء البكسل أو محاذاة التحسينات، فإنه يتنبأ بالتمثيلات المجردة لكتل الهدف المقنعة من كتلة السياق الواحدة — تعلم الدلالات دون توليد الصور مطلقًا.

تتعمق الجولة في السبب في أهمية استراتيجية الإخفاء (يجب أن تكون كتل الهدف كبيرة بما يكفي لفرض التنبؤ الدلالي، ويجب أن تكون كتل السياق غنية بالمعلومات المكانية) وسبب تجنب معمارية التضمين المتنبأ المشترك انهيار التمثيل الذي يطارد الطرق المتناقضة. أرقام الكفاءة هي العنوان الرئيسي: ViT-Huge/14 مدرب على ImageNet في أقل من 72 ساعة على 16 A100، مما يؤدي إلى تصنيف منخفض الطلقة قوي مع 12 مثالاً مصنفًا فقط لكل فئة. بالنسبة لأي شخص يتابع التعلم ذاتي الإشراف بما يتجاوز MAE و DINO — أو فضولي بشأن ما يبدو عليه نموذج العالم بأسلوب LeCun عندما يتم شحنه — فهذا مقدمة مفيدة حول المكان الذي قد يتجه إليه تعلم التمثيل بعد ذلك.