[Olewave's Review] AudioLM: a Language Modeling Approach to Audio Generation

Tutorials

[مراجعة Olewave] AudioLM: نهج لنمذجة اللغة لتوليد الصوت

AudioLM هي الورقة البحثية التي أقنعت الكثيرين بأن توليد الصوت يجب أن يبدو أكثر مثل نمذجة اللغة من معالجة الإشارات.

AudioLM هي الورقة البحثية التي أقنعت الكثيرين بأن توليد الصوت يجب أن يبدو أكثر مثل نمذجة اللغة من معالجة الإشارات. إطار عمل Google يعيّن الموجات الصوتية الخام إلى رموز منفصلة، ثم يدرب نموذج لغة عليها، مما يحول استمرار الصوت إلى التنبؤ برمز التالي. الجزء الذكي هو الرموز الهجينة: تتعامل الرموز الدلالية من نموذج لغة صوتي مقنع بالهيكل طويل الأجل، بينما توفر الرموز الصوتية من برنامج ترميز عصبي التوليف عالي الدقة. معاً يحلان المقايضة التي أرباكت النهج السابقة.

تم تدريب AudioLM على الموجات الصوتية الخام بدون نصوص أو تسميات، حيث تولد استمرارات كلام تبقى متماسكة بناءً على النحو والدلالات مع الحفاظ على هوية المتحدث والنبرة للأصوات غير المرئية. كما يعمم خارج الكلام، منتجاً استمرارات بيانو معقولة دون أي تمثيل موسيقي رمزي. هذا هو السلف الفكري المباشر لـ VALL-E و MusicGen وموجة من أنظمة TTS القائمة على الرموز، لذا فإن فهم تصميم المشفر ذي المرحلتين يدفع أرباحاً عند قراءة أي شيء جاء بعده. إذا كنت تقوم ببناء أو تقييم صوت توليدي قائم على الرموز، فهذه المراجعة مقدمة جديرة بالاهتمام حول الأفكار التي أعادت تشكيل المجال.