مراجعة HiFi-GAN: الشبكات العدائية التوليدية لتوليف الكلام الفعال والعالي الدقة
لفترة طويلة، فرضت المحللات الصوتية العصبية عليك الاختيار بين جانبين: أعطتك نماذج الانحدار الذاتي مثل WaveNet صوتًا جميلًا لكنه بطيء بشكل مؤلم، بينما كانت مولدات الموجات القائمة على GAN سريعة لكن ذات جودة أقل بشكل ملحوظ.
لفترة طويلة، فرضت المحللات الصوتية العصبية عليك الاختيار بين جانبين: أعطتك نماذج الانحدار الذاتي مثل WaveNet صوتًا جميلًا لكنه بطيء بشكل مؤلم، بينما كانت مولدات الموجات القائمة على GAN سريعة لكن ذات جودة أقل بشكل ملحوظ. أغلق HiFi-GAN تلك الفجوة. إنه ينتج صوتًا بتردد 22.05 كيلوهرتز بسرعة 167.9 مرة أسرع من الوقت الفعلي على V100 واحد، ويحصل على درجات آراء متوسطة في نطاق التسجيلات البشرية، وأصبح محللًا صوتيًا افتراضيًا لجزء ضخم من مكدس TTS الحديث.
تركز المراجعة على الرؤية التصميمية التي جعلتها تعمل: الكلام هو مجموع موجات جيبية مع فترات مختلفة كثيرة، لذا يحتاج المميز إلى النظر إلى تلك الفترات بوضوح. مميز HiFi-GAN متعدد الفترات (مقترن بمميز متعدد الحجم) هو ما يدفع الدقة للأعلى بينما يبقى المولد نحيفًا. يغطي الشرح أيضًا مدى جودة تعميمه على المتحدثين غير المرئيين لقلب mel-spectrogram، وسلوكه من طرف إلى طرف TTS، ومتغير صغير يعمل بسرعة 13.4 مرات أسرع من الوقت الفعلي على CPU. إذا كنت تختار محللًا صوتيًا لمنتج TTS في 2024 وتريد أن تفهم لماذا يظل HiFi-GAN الخيار الافتراضي المعقول، فإن هذا الاستعراض اللاحق للمحلل الصوتي يستحق اهتمامك.
