Long Review: Apple's MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training

Tutorials

مراجعة طويلة: MM1 من Apple: الطرق والتحليل والرؤى من التدريب المسبق للنموذج اللغوي متعدد الأنماط

Apple لا تنشر الكثير، لذا عندما ظهرت ورقة MM1 مع دراسة استئصالية كاملة عن التدريب المسبق للنموذج اللغوي متعدد الأنماط، كانت من أكثر إصدارات البيانات المفيدة في السنة لأي شخص يبني MLLMs.

Apple لا تنشر الكثير، لذا عندما ظهرت ورقة MM1 مع دراسة استئصالية كاملة عن التدريب المسبق للنموذج اللغوي متعدد الأنماط، كانت من أكثر إصدارات البيانات المفيدة في السنة لأي شخص يبني MLLMs. هذه المراجعة الطويلة الشكل تمر عبر النتائج بعمق: ما الذي يهم فعلاً عند بناء نموذج متعدد الأنماط بأداء عالية، وما الذي يتبين أنه خطأ تقريبي، وكيف قامت Apple بتوسيع الصيغة إلى عائلة بمعاملات 30B تتضمن نماذج كثيفة و mixture-of-experts متغيرات قادرة على المنافسة في المقاييس المثبتة.

الدروس الرئيسية معاكسة للحدس في بعض الأماكن. محرر الصور بالإضافة إلى دقة الصورة وعدد رموز الصور يحركان معظم الأداء متعدد الأنماط؛ تصميم موصل الرؤية واللغة يتبين أنه ذو أهمية محدودة نسبياً. بالنسبة لبيانات التدريب المسبق، المزيج الصحيح من image-caption و interleaved image-text و text-only sources هو ما يفتح نتائج SOTA few-shot — لا نوع بيانات واحد يكفي بمفرده. MM1 يلتقط أيضاً خصائص ناشئة لطيفة: enhanced in-context learning و multi-image reasoning و few-shot chain-of-thought prompting. إذا كنت تقوم بهندسة نظام متعدد الأنماط وتريد دليل مبني على الاستئصال بدلاً من مخطط لوحة المراتب آخر، فهذا الاستكشاف العميق هو الذي يجب أن تتعمق فيه.