Triplets-like Russian Figure Skaters: Can Kullback-Leibler Divergence be Used Tell Their Difference?

Tutorials

متزلجو الأرقام الروسيون مثل التوائم الثلاثية: هل يمكن استخدام Kullback-Leibler Divergence لتمييز الفرق بينهم؟

تكييف المتحدث هو أحد تلك مشاكل ASR التي تبدو محلولة حتى تحاول فعلاً تكييف نموذج sequence-to-sequence دون تدمير التمثيلات الصوتية الصعبة المكتسبة للمشفر.

تكييف المتحدث هو أحد تلك مشاكل ASR التي تبدو محلولة حتى تحاول فعلاً تكييف نموذج sequence-to-sequence دون تدمير التمثيلات الصوتية الصعبة المكتسبة للمشفر. تستخدم هذه المحادثة الإطار الملحوظ من متزلجي الأرقام الروسيين المتطابقين تقريباً للسؤال عما إذا كان يمكن لـ Kullback-Leibler Divergence أن يميز بين توزيعات المتحدثين المتشابهة جداً، وتستعرض "Listen, Attend, Spell and Adapt": معمارية ASR seq2seq المكيفة بالمتحدث التي تحافظ على النموذج الأساسي سليماً مع التعلم من مكون خفيف الوزن لكل متحدث.

توقع نظرة دقيقة على كيفية منع تنظيم Kullback-Leibler الانجراف الكارثي أثناء التكييف، وكيفية موازنة ميزانيات بيانات التكييف مقابل مكاسب WER، ولماذا تتصرف محولات انتباه النمط LAS بشكل مختلف تحت التكييف من أنظمة HMM الهجينة. بالنسبة لأي شخص يبني واجهات صوتية مخصصة أو مكدسات استنساخ الصوت أو منتجات إملاء مع ملفات صوتية محددة لكل مستخدم، الأفكار هنا تُترجم بشكل مباشر إلى الأنظمة القائمة على Conformer والناقل. اضغط على التشغيل إذا كان تكييف المتحدث أكثر من مجرد فضول في مكدس ASR الخاص بك.