UniSpeech-SAT : التعلم العام لتمثيل الكلام مع التدريب المسبق الموجه للمتحدث
نماذج الكلام ذاتية الإشراف تميل إلى تعلم المحتوى الصوتي بشكل جميل وهوية المتحدث كملاحظة جانبية — وهذا مناسب لـ ASR لكنه سيء جداً للتحقق من المتحدث أو فصل المتحدثين أو استنساخ الصوت.
نماذج الكلام ذاتية الإشراف تميل إلى تعلم المحتوى الصوتي بشكل جميل وهوية المتحدث كملاحظة جانبية — وهذا مناسب لـ ASR لكنه سيء جداً للتحقق من المتحدث أو فصل المتحدثين أو استنساخ الصوت. يسد UniSpeech-SAT من Microsoft هذه الفجوة من خلال إدراج أهداف صريحة تراعي المتحدث في التدريب المسبق على غرار HuBERT: خسارة تناقضية على مستوى الملفوظات ومزج الملفوظات الذي يجبر المشفر على تمثيل من يتحدث وليس فقط ما يقول.
تظهر النتائج عبر معيار SUPERB، حيث يحقق UniSpeech-SAT أرقاماً قوية بشكل خاص في تحديد المتحدث والتحقق منه وفصل المتحدثين مع الحفاظ على الأداء الجيد في ASR واعتراف الفونيمات. تشرح هذه الجلسة كيف يتم بناء مزج الملفوظات، ولماذا لا تضر الحد الإضافي التناقضي التعلم القائم على المحتوى، وكيف مهد التصميم الطريق أمام WavLM بعد فترة وجيزة. إذا كنت تبني أي شيء يحتاج إلى تمييز الأصوات — من نسخ الاجتماعات إلى المصادقة البيومترية — فهذا يستحق 10 دقائق من وقتك.
