[مراجعة Olewave] Whisper ASR من OpenAI: التعرف المتين على الكلام من خلال الإشراف الضعيف على نطاق واسع
عندما أطلقت OpenAI Whisper، اضطر مجتمع ASR للتعامل مع نظام تم تدريبه على 680,000 ساعة من الصوت متعدد اللغات ومتعدد المهام ومجمع من الويب، وقد عمل بشكل جيد مباشرة عبر اللهجات والضوضاء الخلفية والتق
عندما أطلقت OpenAI Whisper، اضطر مجتمع ASR للتعامل مع نظام تم تدريبه على 680,000 ساعة من الصوت متعدد اللغات ومتعدد المهام ومجمع من الويب، وقد عمل بشكل جيد مباشرة عبر اللهجات والضوضاء الخلفية والمصطلحات التقنية. تقيّم هذه المراجعة ما إذا كان Whisper سيفعل لتقنية التعرف على الكلام ما فعله GPT-3 لـ NLP، وتفك الخيارات التصميمية التي تجعل الإشراف الضعيف على نطاق واسع وصفة قوية جداً للقوة والمتانة.
يغطي الشرح معمارية Transformer المشفر-فاك الشيفرة، صيغة التدريب متعددة المهام التي تجمع النسخ والترجمة وتحديد اللغة والكشف عن نشاط الصوت في نموذج واحد، والأوزان المفتوحة المصدر وكود الاستدلال الذي حول Whisper إلى خط أساس فوري لأي مشروع كلام نهائي. كما يشير إلى المقارنات التي يجريها التصميم: المتانة والعالمية اللغوية مقابل ميزانية حسابية غير تافهة وقصة استدلال موجهة نحو الدفعات. إذا كنت لا تزال تشغل خط أنابيب الخاص من Kaldi أو ESPnet أو NeMo وتتساءل عما إذا كان يجب عليك استبدال Whisper، أو إذا كنت تريد أن تفهم حلقة البيانات والحجم التي تقود نماذج أساس الكلام الآن، فإن هذا يستحق أن تضيفه إلى قائمتك قبل قرارك المعماري التالي.
