From OpenAI's Whisper Model to Your Own In-House ASR Service: Long Audio and Streaming (Part 3)

Tutorials

من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: الصوت الطويل والبث المباشر (الجزء 3)

تم تدريب Whisper على أجزاء مدتها 30 ثانية، وهذا يظهر عندما تطعمه بودكاست لمدة ساعتين أو تحاول ربطه بخط أنابيب الترجمة المباشرة.

تم تدريب Whisper على أجزاء مدتها 30 ثانية، وهذا يظهر عندما تطعمه بودكاست لمدة ساعتين أو تحاول ربطه بخط أنابيب الترجمة المباشرة. التكرارات المهلوسة، وانجراف المقاطع الصامتة، وزيادة الكمون مع طول الصوت هي جميعها أعراض نفس القيد الأساسي — لم يتم بناء النموذج للصيغ الطويلة أو البث المباشر خارج الصندوق. الجزء 3 من سلسلة نشر Whisper هذه يعالج كلا المشكلتين مباشرة.

يمر المقطع بالاستراتيجيات العملية للاستدلال الصوتي الطويل: التقسيم القائم على VAD، والتداخل والخياطة لتجنب الحروف الأثرية الحدودية، واستخدام نص النافذة السابقة كموجه فك تشفير لإبقاء السياق متدفقاً. من جانب البث المباشر، يغطي فك التشفير المقسم مع النظر للأمام، ضبط المقايضة بين الكمون والاستقرار، وحيث تساعد نسخ Whisper المنقسمة للبث المباشر من المجتمع (مثل whisper-streaming و faster-whisper) بالفعل مقابل حيث تحتاج إلى لاصق مخصص. إذا كنت تبني تسريات مباشرة أو روبوتات اجتماعات أو أي منتج يضطر إلى نسخ الصوت أطول من حقل استقبال Whisper، فهذا هو الجزء من السلسلة الذي تحتاج إلى تشغيله.