Movie Gen من Meta مقابل Sora من OpenAI: مراجعة تفصيلية
أخيراً كشفت Meta عن يدها ضد Sora، و Movie Gen هو أكثر من مجرد مولد فيديو — إنه مجموعة من نماذج الأساس التي تنتج فيديو HD بدقة 1080p عبر نسب عرض متعددة مع صوت مت…
تحليل الباحث من Google المتعمق حول الكلام من طرف إلى طرف، الجزء 1: النظرة العامة والنمذجة
قلل عقد من التعلم العميق معدلات أخطاء كلمات ASR بأكثر من 50 في المئة نسبة، وفي هذه العملية، جعل خطوط أنابيب HMM الكلاسيكية تبدو مثل التراث.
استنتاج معمارية الشبكة العصبية لـ OpenAI GPT-4o
لم تنشر OpenAI ورقة عن GPT-4o، لذا يفعل هذا الفيديو الشيء التالي الأفضل: فهو يقوم بهندسة عكسية لمعمارية الشبكة العصبية التي تبدو أنها بالتأكيد ستكون بناءً على ا…
نموذج Google للكلام العام لـ 100+ لغة يتفوق على نموذج OpenAI Whisper
أنجزت نموذج Google للكلام العام بهدوء شيئاً رائعاً: طابقت أو تفوقت على Whisper من OpenAI في ASR عبر أكثر من 100 لغة مع استخدام ما يقرب من سُبع البيانات المسمى الم…
الكشف عن نموذج رؤية+نص OpenAI GPT-4 والبيانات وتكلفة التدريب (متكهن بها)
رفضت OpenAI بشهرة الكشف عن هندسة معمارية GPT-4 وعدد المعاملات وبيانات التدريب أو ميزانية الحوسبة، مما حول التقرير التقني إلى اختبار Rorschach لمجتمع ML.
مراجعة التقرير الفني لـ GPT-4 (GPT-4 بإيجاز)
يشتهر التقرير التقني لـ GPT-4 بأنه يفتقر إلى تفاصيل الهندسة المعمارية ويركز بشكل كبير على مطالبات الإمكانيات، مما يجعل المراجعة الموضوعية قراءة ضرورية لأي شخص …
[مراجعة Olewave] AudioLM: نهج لنمذجة اللغة لتوليد الصوت
AudioLM هي الورقة البحثية التي أقنعت الكثيرين بأن توليد الصوت يجب أن يبدو أكثر مثل نمذجة اللغة من معالجة الإشارات.
مراجعة متعمقة لـ GPT-3 من OpenAI: Language Models are Few-Shot Learners (الجزء 3/3: النتائج والبقية)
يصل الجزء الأخير من هذا الفحص العميق لـ GPT-3 ذي الثلاثة أجزاء إلى النقطة المهمة: ماذا يحدث بالفعل عندما تطبق 175 مليار معامل على مجموعة المعايير وتتجاوز الضبط…
[10 mins] اشرح لماذا Whisper API من OpenAI ليس جيدًا مثل ChatGPT
حقق Whisper نجاحًا كبيرًا، لكنه لم يعيد تشكيل ASR بالطريقة التي أعادت بها GPT-3 تشكيل NLP، وتجادل هذه المراجعة لمدة عشر دقائق بأن الأسباب مدمجة في الورقة البحثية…
مراجعة متعمقة في GPT-3 من OpenAI: نماذج اللغة تتعلم من عينات قليلة (الجزء 2/3: النتائج)
ينتقل الجزء الثاني من هذا الغوص العميق في GPT-3 بعد الإعداد إلى النتائج التي جعلت الناس فعلاً يعيدون التفكير في NLP.
مراجعة متعمقة في GPT-3 من OpenAI: نماذج اللغة تتعلم من عينات قليلة (الجزء 1/3: المقدمة والنهج)
يعرض الجزء الأول من هذه المراجعة الثلاثية الأجزاء لـ GPT-3 الورقة التي حولت التوسع من رهان بحثي إلى حقيقة مسلمة في الصناعة.
ChatGPT/ChatGPT Plus/InstructGPT: تدريب نماذج اللغة على متابعة التعليمات برد فعل بشري
خلف منتج ChatGPT تقف ورقة InstructGPT، وتفكك هذه المراجعة المفصلة خط الأنابيب الذي حول GPT-3 الخام إلى شيء يريد الناس فعلاً التحدث معه.
شرح كيفية عمل ChatGPT/ChatGPT Plus في 3 دقائق
يبدو ChatGPT وكأنه سحر من الخارج، لكن الوصفة موثقة جيداً إذا كنت تعرف أين تبحث، وهذا الشارح لمدة ثلاث دقائق يكثف الأفكار الأساسية.
[Olewave's Review] CLIP (3/3): تعلم النماذج البصرية القابلة للنقل من الإشراف باللغة الطبيعية
يقع الجزء الأخير من هذا الاستعراض CLIP في قسم النتائج، وهو حيث حول نموذج OpenAI المقابل للصور والنصوص من فكرة مثيرة للاهتمام إلى عنصر بدائي على مستوى الأساس لم…
[Olewave's Review] CLIP (2/3): تعلم النماذج البصرية القابلة للنقل من الإشراف باللغة الطبيعية
قلبت CLIP من OpenAI مسار الرؤية الحاسوبية بالتخلص من مجموعات التسميات الثابتة والتدريب بدلاً من ذلك على 400 مليون زوج (صور، نصوص) مكشوطة من الإنترنت.
[Olewave's Review] CLIP (1/3): تعلم النماذج البصرية القابلة للنقل من الإشراف باللغة الطبيعية
قبل أن يكون هناك BLIP أو LLaVA أو أي speech-LLM جدير بالاهتمام، كان CLIP موجوداً، وهنا حيث تبدأ القصة.
[مراجعة Olewave] Whisper ASR من OpenAI: التعرف المتين على الكلام من خلال الإشراف الضعيف على نطاق واسع
عندما أطلقت OpenAI Whisper، اضطر مجتمع ASR للتعامل مع نظام تم تدريبه على 680,000 ساعة من الصوت متعدد اللغات ومتعدد المهام ومجمع من الويب، وقد عمل بشكل جيد مباش…
[Long Review] نماذج الانتشار المتسلسلة لتوليد الصور عالية الدقة
قبل أن تجعل Imagen و DALL-E 2 الانتشار المعيار الافتراضي لتوليد الصور، وضعت ورقة Google Brain وصفة الانتشار المتسلسلة التي استعارتها الكثير من الأنظمة النصية إ…
[Short Review] نماذج الانتشار المتسلسلة لتوليد الصور عالية الدقة
الانتشار المتسلسل هو وصفة من مرحلتين فما فوق تحت الكثير من العمل التوليدي الحديث: توليد صورة صغيرة بنموذج انتشار واحد، ثم تسليمها إلى نماذج انتشار عالية الدقة …
