[Olewave's Review] CLIP (3/3): تعلم النماذج البصرية القابلة للنقل من الإشراف باللغة الطبيعية
يقع الجزء الأخير من هذا الاستعراض CLIP في قسم النتائج، وهو حيث حول نموذج OpenAI المقابل للصور والنصوص من فكرة مثيرة للاهتمام إلى عنصر بدائي على مستوى الأساس لم…
[Olewave's Review] CLIP (2/3): تعلم النماذج البصرية القابلة للنقل من الإشراف باللغة الطبيعية
قلبت CLIP من OpenAI مسار الرؤية الحاسوبية بالتخلص من مجموعات التسميات الثابتة والتدريب بدلاً من ذلك على 400 مليون زوج (صور، نصوص) مكشوطة من الإنترنت.
[Olewave's Review] CLIP (1/3): تعلم النماذج البصرية القابلة للنقل من الإشراف باللغة الطبيعية
قبل أن يكون هناك BLIP أو LLaVA أو أي speech-LLM جدير بالاهتمام، كان CLIP موجوداً، وهنا حيث تبدأ القصة.
ارتفاع وسقوط Boris Johnson - تحليل الميكروفونات
الأخبار السياسية عادة ليست ما يشغله مهندسو صوت الذكاء الاصطناعي ليوم الجمعة بعد الظهر، لكن إعلان استقالة Boris Johnson، الذي تم إلقاؤه أمام مصفوفة من الميكروفو…
[Olewave's Long Review] Xception: التعلم العميق مع Depthwise Separable Convolutions
أخذ Xception فرضية Inception إلى أقصاها المنطقي بدفع الارتباطات عبر القنوات والمكانية إلى عمليات منفصلة تماماً، والتحويلات Depthwise Separable التي روّجت لها تظه…
رادار المصفوفة المرحلية على حاملة الطائرات الصينية Fujian 003 وصلتها بتشكيل شعاع الكلام
مصفوفة الرادار المرحلية المثبتة على أحدث حاملة طائرات صينية، Fujian 003، ومصفوفات الميكروفون التي تسمح لمكبر الصوت الذكي الخاص بك بسماعك عبر غرفة صاخبة تشترك ف…
كيف يعمل الإملاء الجديد تماماً في iOS 16؟ كشف الصيغة السرية لشركة Apple من قبل باحث الكلام!
يعمل الإملاء في iOS 16 من Apple بالكامل على الجهاز، وهذا الخيار التصميمي الوحيد له تداعيات متسلسلة على الكمون والخصوصية، وأنواع معماريات ASR التي تكون قابلة لل…
[مراجعة طويلة] Conformer: Transformer معزز بالالتفاف للتعرف على الكلام
Conformer هو النموذج الذي استحوذ بهدوء على ASR من النهاية إلى النهاية، وصيغته، وضع وحدة التفاف على كل كتلة Transformer، تبين أنها واحدة من تلك الأفكار البسيطة …
[Long Review] نماذج الانتشار المتسلسلة لتوليد الصور عالية الدقة
قبل أن تجعل Imagen و DALL-E 2 الانتشار المعيار الافتراضي لتوليد الصور، وضعت ورقة Google Brain وصفة الانتشار المتسلسلة التي استعارتها الكثير من الأنظمة النصية إ…
[Short Review] نماذج الانتشار المتسلسلة لتوليد الصور عالية الدقة
الانتشار المتسلسل هو وصفة من مرحلتين فما فوق تحت الكثير من العمل التوليدي الحديث: توليد صورة صغيرة بنموذج انتشار واحد، ثم تسليمها إلى نماذج انتشار عالية الدقة …
[Long Review] الانتباه المحوري في المحولات متعددة الأبعاد
الانتباه الذاتي الكامل على صورة أو فيديو مكلف للغاية، فكيف تحافظ على التعبيرية للمحول بدون الانفجار التربيعي؟
[Short Review] الانتباه المحوري في المحولات متعددة الأبعاد
الانتباه المحوري هو أحد تلك الأفكار الأنيقة التي تحافظ على المحولات قابلة للتعامل معها على البيانات عالية الأبعاد: بدلاً من الانتباه على كل بكسل أو كل صندوق وقت…
[مراجعة طويلة] نقل التعلم من التحقق من المتحدث إلى تحويل النص إلى كلام متعدد المتحدثين
هذه هي الورقة التي جعلت استنساخ الصوت بدون أمثلة عملياً: قم بتدريب مشفر المتحدث على مهمة التحقق التمييزية باستخدام آلاف الأصوات الضاخة والخالية من النصوص، ثم أد…
[مراجعة قصيرة] نقل التعلم من التحقق من المتحدث إلى تحويل النص إلى كلام متعدد المتحدثين
ورقة Google التي بدأت موجة استنساخ الصوت الحديثة بدون أمثلة لديها بنية نظيفة وجميلة: مشفر متحدث مدرب على التحقق، محلل Tacotron 2 الذي يحول النص بالإضافة إلى تض…
[مراجعة قصيرة] Wav2Seq: نماذج مشفر-فاك مدرب مسبقاً للكلام إلى نص باستخدام لغات وهمية
وفر التدريب المسبق غير الخاضع للإشراف مثل wav2vec 2.0 مشفرات كلام ممتازة لنا، لكن بالنسبة لنظام ASR كامل مشفر-فاك، كان الفاك لا يزال يبدأ من الصفر.
[Long Review] نحو التعلم اللغوي بدون تسميات
ماذا لو كان بإمكانك تدريب نماذج NLP خاصة بمهام محددة دون مثال واحد مسمى من قبل البشر؟ "نحو التعلم اللغوي بدون تسميات" يركز بشدة على هذا السؤال.
[Long Review] Fully Sharded Data Parallel: تدريب ذكاء اصطناعي أسرع مع معالجات رسوميات أقل
كان تدريب نموذج كلام أو لغة ذو مليار معامل على ميزانية GPU متواضعة يعني الاختيار بين التوازي في خط الأنابيب أو التوازي الموتري أو تجزئة المحسن من نمط ZeRO.
[Short Review] Fully Sharded Data Parallel: تدريب ذكاء اصطناعي أسرع مع معالجات رسوميات أقل
Fully Sharded Data Parallel هي إجابة Meta على سؤال تسأله كل فريق كلام ولغة في النهاية: كيف نقوم بتدريب نماذج أكبر بكثير دون الحاجة إلى معالجات رسوميات أكثر بكث…
[مراجعة قصيرة] إلغاء تكرار بيانات التدريب يجعل نماذج اللغة أفضل
كم من "التعميم" في نموذج اللغة الخاص بك هو في الواقع مجرد إعادة إنتاج؟
