الذكاء الاصطناعي التوليدي للكلام: VoiceBox من Meta AI (أيضًا Flow Matching و Neural ODE)
لسنوات عديدة، تخلف توليد الكلام عن توليد النص والصور من حيث النطاق والعمومية — حصلت كل مهمة على نموذج مخصص بها.
لسنوات عديدة، تخلف توليد الكلام عن توليد النص والصور من حيث النطاق والعمومية — حصلت كل مهمة على نموذج مخصص بها. كسرت VoiceBox من Meta AI هذا النمط. إنه نموذج flow-matching غير تراجعي مدرب على أكثر من 50000 ساعة من الكلام غير المفلترة للقيام بشيء واحد بشكل جيد: ملء الصوت بالنظر إلى السياق المحيط والنص. يفتح هذا الهدف الواحد Zero-shot TTS والتركيب عبر اللغات وإزالة الضوضاء وتحرير المحتوى ونقل الأسلوب، كل ذلك من نقطة التفتيش نفسها.
تستعرض المراجعة السبب في أن flow matching (والآلية العصبية ODE تحتها) مناسبة جدًا للكلام — مستمرة وغير تراجعية وأسرع بشكل كبير من الانتشار بجودة قابلة للمقارنة. كما تضع الأرقام الرئيسية في السياق: تتفوق Voicebox على VALL-E في كل من الفهم (1.9٪ مقابل 5.9٪ WER) والتشابه الصوتي بينما تعمل بسرعة تصل إلى 20 مرة أسرع. إذا كنت تتابع المكان الذي يتجه إليه نماذج أساس الكلام بعد VALL-E و Whisper، أو كنت تريد فهم ما يفعله flow matching بدلاً من مجرد قراءة المصطلح الرنان، فإن الغوص العميق يستحق الاستماع.
