[10 mins] اشرح لماذا Whisper API من OpenAI ليس جيدًا مثل ChatGPT
حقق Whisper نجاحًا كبيرًا، لكنه لم يعيد تشكيل ASR بالطريقة التي أعادت بها GPT-3 تشكيل NLP، وتجادل هذه المراجعة لمدة عشر دقائق بأن الأسباب مدمجة في الورقة البحثية نفسها.
حقق Whisper نجاحًا كبيرًا، لكنه لم يعيد تشكيل ASR بالطريقة التي أعادت بها GPT-3 تشكيل NLP، وتجادل هذه المراجعة لمدة عشر دقائق بأن الأسباب مدمجة في الورقة البحثية نفسها. تم تدريب النموذج على 680،000 ساعة من البيانات المراقبة متعددة اللغات والمهام المجمعة من الويب، وقد حسّن الاستقرار فعليًا أمام اللهجات والضوضاء الخلفية والمفردات التقنية مع إضافة الترجمة إلى اللغة الإنجليزية كميزة إضافية. لكن القفزة بدت تدريجية مقارنة بما فعله ChatGPT للنصوص.
يشرح الفيديو السبب: للإشراف الضعيف من نصوص الويب أنماط فشل مختلفة عن البيانات المصنفة بشكل صحيح، وحد ASR يتم تحديده بواسطة الغموض الصوتي بطرق لا ينطبق عليها التنبؤ بالرمز التالي، والتعميم من نقطة الصفر للنموذج لا يتراكم بنفس الطريقة في LLMs. بالنسبة لأي شخص يقرر ما إذا كان سيقوم بضبط دقيق لـ Whisper أو استبدال نموذج NeMo أو ESPnet أو الانتظار للجيل التالي من نماذج أساس الكلام، فإن الإطار هنا مفيد. إنها نظرة سريعة وحاسمة تستحق خمس دقائق إذا كنت تطلق ASR في الإنتاج.
