مراجعة DiTAR: نمذجة Diffusion Transformer الانحدارية التلقائية لتوليد الكلام ~ Seed-TTS
فريق Seed-TTS عاد مع DiTAR، وهي إجابة نظيفة على أحد المقايضات الأكثر حرجاً في توليد الكلام الحديث: كيف تحافظ على مرونة التمثيلات الكلامية المستمرة دون دفع تكلفة
فريق Seed-TTS عاد مع DiTAR، وهي إجابة نظيفة على أحد المقايضات الأكثر حرجاً في توليد الكلام الحديث: كيف تحافظ على مرونة التمثيلات الكلامية المستمرة دون دفع ضريبة الحساب التي عادة ما تطلبها أكوام الانتشار الهجينة بالإضافة إلى الانحدار التلقائي، وبدون الاستقرار على النتائج الأقل من المثالية التي تميل تلك المجموعات إلى إنتاجها؟ يتجاوز DiTAR رموز الكلام المنفصلة تماماً، باستخدام إطار عمل قائم على الرقعة الذي يقرن نموذج اللغة مع Diffusion Transformer لتوليد الصوت بكفاءة.
تتعمق المراجعة في خدعة فرق وتسليم في قلب النموذج - LM يمضغ تضمينات الرقعة المجمعة ويسلمها إلى Diffusion Transformer لإنتاج الرقعة التالية بشرط هذا الإخراج - بالإضافة إلى عقدة ذكية في وقت الاستدلال التي تعيد تعريف درجة الحرارة كنقطة حقن الضوضاء في ODE الانتشار العكسي، مما يمنحك اتصالاً نظيفاً بين التنوع والحتمية. التحليل الشامل للتوسع والمعايير الصفرية للتدريب على المتانة وتشابه المتكلم والطبيعية كلها في النطاق، مع DiTAR نشر أرقام SOTA عبر المجلس. إذا كنت تتبع إلى أين يتجه توليد الكلام الانحداري التلقائي بعد VALL-E و Seed-TTS، فإن هذا الفحص المتعمق يستحق الانتظار.
