استكشاف ضبط Wav2vec 2.0 الدقيق لتحسين التعرف على المشاعر الكلامية
لطالما كان التعرف على المشاعر الكلامية عالقاً مع مجموعات بيانات صغيرة مُحددة والميزات الصوتية المصنوعة يدويّاً.
التدريب المشترك بدون إشراف وبإشراف للتعرف التلقائي على الكلام متعدد اللغات
أصبح التدريب المسبق ثم الضبط الدقيق هو الوصفة الافتراضية للتعرف التلقائي على الكلام متعدد اللغات، لكنه يترك الكثير على الطاولة: المرحلتان لا تتشاركان الخسائر، …
WavLM: التدريب المسبق ذاتي الإشراف على نطاق واسع لمعالجة الكلام الشاملة
معظم نماذج SSL للكلام تحسّن من أجل ASR وتأمل أن ينجح كل شيء آخر.
تحسين دقة التعرف على الكلام لـ POI المحلي باستخدام نماذج جغرافية
اطلب من مساعد صوتي نقلك إلى مطعم محلي صغير وستجد بسرعة حيث ينهار ASR — أسماء POI ذات الذيل الطويل التي لم تظهر أبداً في مجموعة تدريب LM.
XLS-R: تعلم تمثيلات الكلام الإشرافي الذاتي عبر اللغات على نطاق واسع
إلى أي حد يمكنك دفع التدريب المسبق للكلام عبر اللغات قبل نضوب الموارد؟
قوانين التوسع لنماذج اللغة العصبية
قبل أن يجعل GPT-3 التوسع يبدو حتمياً، جعلت هذه الورقة البحثية من OpenAI التنبؤ به ممكناً.
UniSpeech-SAT : التعلم العام لتمثيل الكلام مع التدريب المسبق الموجه للمتحدث
نماذج الكلام ذاتية الإشراف تميل إلى تعلم المحتوى الصوتي بشكل جميل وهوية المتحدث كملاحظة جانبية — وهذا مناسب لـ ASR لكنه سيء جداً للتحقق من المتحدث أو فصل المتحد…
RefineGAN: توليد الموجة الصوتية عالمياً بشكل أفضل من الحقيقة الأساسية بدقة عالية في الارتفاع و
"أفضل من الحقيقة الأساسية" هو نوع الادعاء الذي يجعلك إما تدير عينيك أو تضغط على التشغيل.
تدريب الهدف SNRi للتحسين المشترك للكلام والتعرف عليه
يبدو التدريب المشترك لتحسين الكلام و ASR واضحاً — فقط قم بنشر خسارة التعرف عبر مزيل الضوضاء — لكن في الممارسة العملية فهو فوضوي، لأن إزالة الضوضاء العدوانية غال…
BigSSL: استكشاف حدود التعلم شبه الموجه واسع النطاق للتعرف التلقائي على الكلام
ماذا يحدث عندما تأخذ وصفة ASR شبه الموجهة التي تغلبت على أحدث التقنيات عند 100M معاملة وتستمر في التوسع؟
