مراجعة Seed-TTS من ByteDance/Tiktok: عائلة من نماذج توليد الكلام متعددة الاستخدامات عالية الجودة
Seed-TTS من ByteDance هي واحدة من أقوى الإشارات حتى الآن بأن TTS تتخرج من مكون إلى نموذج أساسي حقيقي.
Seed-TTS من ByteDance هي واحدة من أقوى الإشارات حتى الآن بأن TTS تتخرج من مكون إلى نموذج أساسي حقيقي. تمشي هذه المراجعة خلال العائلة بأكملها - مكدس انحداري تلقائي على نطاق واسع يصل إلى درجات تشابه المتكلم والطبيعية غير قابلة للتمييز بشكل أساسي عن كلام الإنسان الحقيقي في كل من التقييمات الموضوعية والذاتية، بالإضافة إلى نسخة قائمة على الانتشار الكامل غير الانحدارية التلقائية تسمى Seed-TTS_DiT التي تتخطى مدة الفونيم المقدرة مسبقاً تماماً وتفعل توليد الكلام من خلال المعالجة النهائية. الضبط الدقيق يدفع الدرجات الذاتية أعلى بعد ذلك، مع السيطرة القوية على العاطفة والسمات التعبيرية الأخرى للمتحدثين في البرية.
بعيداً عن أرقام الجودة الرئيسية، البتات المثيرة للاهتمام معمارية وطرق: وصفة التقطير الذاتي لتحليل الكلام التي تسمح لك بفصل السمات بنظافة، وحلقة ضبط دقيق للتعليم المعزز التي تدفع المتانة وتشابه المتكلم والسيطرة أبعد من التدريب الخاضع للإشراف وحده. متغير DiT يفتح أيضاً تحرير الكلام بطريقة لم تتمكن الأنظمة NAR القديمة من لمسها. إذا كنت تقيم ما يبدو عليه نموذج أساسي للكلام الحديث - لاستنساخ الصوت أو التوليف التعبيري أو المزامنة أو تعلم الكلام الذي يحدث السياق - ستوجهك خمس دقائق مع هذه المراجعة بسرعة.
