A Review of Deepmind's WaveNet for TTS/Audio Synthesis (Does it look like GPT to you?)

Tutorials

مراجعة WaveNet من DeepMind لتوليف TTS/الصوت (هل يبدو لك مثل GPT؟)

قبل Tacotron، قبل VALL-E، قبل أن تحول الأكوديكات العصبية الصوت إلى رموز، كانت ورقة WaveNet من DeepMind هي التي أظهرت أن الشبكات العصبية يمكنها إنشاء أشكال موجات صوتية خام عينة تلو عينة والتفوق على كل

قبل Tacotron، قبل VALL-E، قبل أن تحول الأكوديكات العصبية الصوت إلى رموز، كانت ورقة WaveNet من DeepMind هي التي أظهرت أن الشبكات العصبية يمكنها إنشاء أشكال موجات صوتية خام عينة تلو عينة والتفوق على كل نظام TTS معياري واصطناعي في الطبيعية. انظر إليها الآن، من خلال عدسة GPT، والتشابه لافت للنظر: نموذج احتمالي بالكامل وانحداري ذاتي يشترط كل عينة على جميع العينات السابقة — نموذج لغة للصوت، قبل خمس سنوات من أن تصبح LLMs مصطلحًا منزليًا.

تتناول المراجعة العمارة التي جعلتها تعمل عند 16 كيلوهرتز: الالتفافات السببية المتسعة لتنمية المجال الاستقبالي بشكل كبير، التفعيلات المبوابة، الاتصالات المتبقية والمتخطية. كما تغطي ما أظهره WaveNet وراء TTS — تكييف المتحدث لتبديل الأصوات، توليد الموسيقى كمنتج ثانوي، وحتى الاعتراف بالفونيم التنافسي كنموذج تمييزي. إذا كنت تريد أن ترى من أين بدأت الذكاء الاصطناعي التوليدي للكلام الحديث فعلاً، ولماذا يستمر النموذج الانحداري الذاتي للرموز فوق الصوت في العودة في أنظمة TTS الأحدث، فإن هذا الاستعراض اللاحق يوفر تأسيسًا رائعًا.