HuBERT: تعلم التمثيل الكلامي ذاتي الإشراف من خلال التنبؤ المقنع بالوحدات المخفية
غيّرت wav2vec 2.0 قواعد اللعبة بالإشراف الذاتي التباعدي، لكن HuBERT طرح سؤالاً أكثر حدة: ماذا لو تجاوزنا خدعة التباعد كلياً وقمنا فقط بالتنبؤ المقنع على غرار BERT على الكلام؟
غيّرت wav2vec 2.0 قواعد اللعبة بالإشراف الذاتي التباعدي، لكن HuBERT طرح سؤالاً أكثر حدة: ماذا لو تجاوزنا خدعة التباعد كلياً وقمنا فقط بالتنبؤ المقنع على غرار BERT على الكلام؟ المشكلة هي أن الصوت ليس له مفردات طبيعية، لذا يقوم HuBERT بتجهيز خاصته الخاصة — تجميع MFCCs أولاً، ثم إعادة تجميع حالات النموذج الخفية بشكل متكرر — وتدريب المحول على التنبؤ بتلك الملصقات الكاذبة في الإطارات المقنعة.
الفائدة هي هدف أنظف، وعلى LibriSpeech و Libri-light، تحقق النتائج تطابقاً أو تتفوق على wav2vec 2.0 عند كل مقياس نموذج من Base إلى X-Large. يرشدك هذا الغوص العميق من Meta AI عبر حلقة تجهيز k-means، لماذا تظهر الوحدات الصوتية من التكرار، وكيف ينتقل نفس التدريب المسبق بنظافة إلى ASR وتحديد المتحدث ومهام المشاعر. أصبح HuBERT منذ ذلك الحين واحداً من نقاط البداية الافتراضية على HuggingFace لأي شخص يعمل في مجال تمثيل الكلام، لذا إذا كنت تختار encoder لمشروعك التالي في ASR أو SLU، فإن قضاء بضع دقائق على الحدس هنا سيوفر لك ساعات من تخمين المعاملات الفائقة لاحقاً.
