مراجعة متعمقة لـ SoundStream من Google: أكوديك صوتي عصبي من النهاية إلى النهاية
أصبحت الأكوديكات العصبية بهدوء الطبقة الأساسية للصوت التوليدي الحديث، و SoundStream هي إحدى الأوراق الرائدة في هذا المجال.
أصبحت الأكوديكات العصبية بهدوء الطبقة الأساسية للصوت التوليدي الحديث، و SoundStream هي إحدى الأوراق التي بدأت هذا المجال. يقترن التصميم من النهاية إلى النهاية من Google محلل التفافي بالكامل/فك محلل مع مكمم متجه متبقي، تم تدريب جميعها معًا مع خسائر العدائية وإعادة البناء المستعارة من عوالم TTS وتحسين الكلام. النتيجة الرئيسية مذهلة: عند 3 كيلوبت في الثانية، يتفوق SoundStream على Opus عند 12 كيلوبت في الثانية ويقترب من EVS عند 9.6 كيلوبت في الثانية على صوت 24 كيلوهرتز، عبر الكلام والموسيقى والصوت العام.
وراء أرقام الضغط، تعتبر خيارات التصميم مهمة لأي شخص يطلق منتجات تكنولوجيا صوتية. يسمح الحذف المنظم عبر طبقات المكمم لنموذج واحد بالعمل عند معدلات بيانات من 3 إلى 18 كيلوبت في الثانية دون إعادة تدريب، والعمارة تعمل في الوقت الفعلي على معالج هاتف ذكي مع استنتاج قابل للبث. تدمج الورقة أيضًا قمع الضوضاء الخلفية مباشرة في الأكوديك على جانب المشفر أو فك الشفرة، دون أي زمن تأخير إضافي. إذا كنت تعمل على رموز TTS عصبية أو اتصالات منخفضة معدل البيانات أو خطوط معالجة صوت الخاص، فإن هذا الشرح يوفر أساسًا قويًا في الأفكار التي دفعت AudioLM وأحفادها لاحقًا. اضغط التشغيل لعرض تفصيل العمارة ونتائج التقييم الموضوعية.
