XLS-R: Self supervised Cross lingual Speech Representation Learning at Scale

Tutorials

XLS-R: تعلم تمثيلات الكلام الإشرافي الذاتي عبر اللغات على نطاق واسع

إلى أي حد يمكنك دفع التدريب المسبق للكلام عبر اللغات قبل نضوب الموارد؟

إلى أي حد يمكنك دفع التدريب المسبق للكلام عبر اللغات قبل نضوب الموارد؟ تجيب XLS-R من Meta بملياري معامل مدربة على 436 ألف ساعة من الصوت غير المصنف عبر 128 لغة — قفزة بترتيب الحجم مقارنة ب XLSR-53 وعند الإصدار، أكبر نموذج كلام متعدد اللغات عام بهامش واسع.

تؤكد النتائج على قصة التوسع. تحدد XLS-R معايير جديدة على BABEL و CommonVoice و VoxPopuli للتعرف على الكلام، وأيضاً — وبشكل أكثر إثارة للدهشة — على الترجمة الكلامية إلى الإنجليزية، حيث تتفوق على الأنظمة السابقة المبنية على نماذج نصية أكبر بكثير. يتناول الحديث تجميع البيانات عبر تلك 128 لغة، وكيف يصمد معمار wav2vec 2.0 عند 2 مليار معامل، وما الذي ينكسر عندما تحاول ضبط شيء بهذا الحجم على بيانات قليلة الموارد. إذا كنت تعمل على أي مهمة كلام في لغة لا تغطيها HuggingFace بالفعل، فإن XLS-R ربما تكون أول نقطة تفتيش يجب أن تجربها — يشرح الغوص العميق السبب.