[Short Review] Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis

Tutorials

[مراجعة قصيرة] نقل التعلم من التحقق من المتحدث إلى تحويل النص إلى كلام متعدد المتحدثين

ورقة Google التي بدأت موجة استنساخ الصوت الحديثة بدون أمثلة لديها بنية نظيفة وجميلة: مشفر متحدث مدرب على التحقق، محلل Tacotron 2 الذي يحول النص بالإضافة إلى تضمين المتحدث

ورقة Google التي بدأت موجة استنساخ الصوت الحديثة بدون أمثلة لديها بنية نظيفة وجميلة: مشفر متحدث مدرب على التحقق، محلل Tacotron 2 الذي يحول النص بالإضافة إلى تضمين المتحدث إلى طيف ميل، ومحلل الصوت WaveNet الذي يرسم شكل الموجة. أعطِها بضع ثوان من صوت جديد وستتحدث نصاً جديداً بذلك الصوت، دون أن تكون قد تدربت على ذلك المتحدث من قبل.

تركز هذه المراجعة القصيرة لعمل Jia وزملاؤه على الأساسيات: كيف يتناسب خط الأنابيب ثلاثي الوحدات معاً، لماذا ينتقل مشفر المتحدث المدرب بشكل تمييزي بشكل جيد جداً، والاكتشاف المثير أن التضمينات المأخوذة عشوائياً حتى تنتج أصواتاً اصطناعية معقولة. إذا كانت خريطة طريق منتجك تتعلق بـ TTS الشخصي أو استنساخ الصوت أو تكيف المتحدث، فهذا يستحق 5 دقائق من وقتك كنقطة انطلاق سريعة للورقة الكاملة.