مراجعة SpeechT5: إدخال T5 من Google إلى مهام الكلام (ASR, TTS, SID, ...)
وحّد T5 مهام النص إلى النص تحت وصفة تدريب مسبق واحدة للمشفر-فك الشفرة وأصبح حصان العمل في NLP.
وحّد T5 مهام النص إلى النص تحت وصفة تدريب مسبق واحدة للمشفر-فك الشفرة وأصبح حصان العمل في NLP. يسأل SpeechT5 المتابعة الواضحة: هل يمكن لنفس الحيلة توحيد مهام الكلام؟ الإجابة، من هذا العمل في Microsoft Research، هي نعم إلى حد كبير. يتم تغليف مشفر-فك شفرة مشترك في ستة شبكات محددة مسبقة وما بعد الشبكات الخاصة بالشكل، بحيث يمكن للشبكة الأساسية نفسها استهلاك الكلام أو النص وإصدار الكلام أو النص — مما يتيح ASR وTTS وتحويل الصوت وترجمة الكلام وتحسين الكلام وتحديد المتحدث من نقطة تفتيش واحدة مدربة مسبقًا.
تتناول المراجعة خدعة تكميم المتجهات العابرة للأوضاع التي توائم بين الكلام والنص في فضاء كامن مشترك، وتشرح لماذا يسمح هذا التوائم لنموذج واحد بالتعميم عبر مهام مختلفة جدًا. كما تغطي كيفية أداء SpeechT5 في كل معيار أسفل الاتجاه وأين يتخلف النهج الموحد عن المتخصصين أحاديي المهام. إذا كنت تفكر في نماذج أساس كلام متعددة المهام — أو تريد أن ترى مثالًا مبكرًا وواضحًا لنمط التصميم الذي ظهر لاحقًا في Voicebox و SeamlessM4T — فإن هذه المراجعة توفر أساسًا صلبًا.
