لماذا الطوابع الزمنية للكلمات التي ينتجها OpenAI Whisper غير دقيقة؟ كيف تجعلها دقيقة مرة أخرى؟
اطلب من Whisper طوابع زمنية للكلمات وستحصل على أرقام — لكن إذا حاولت يومًا ما محاذاتها مع الصوت الفعلي للكاريوكي أو الترجمة أو المزامنة، ستعرف أنها تنجرف وتنجذب إلى حدود خاطئة، وأحيانًا
اطلب من Whisper طوابع زمنية للكلمات وستحصل على أرقام — لكن إذا حاولت يومًا ما محاذاتها مع الصوت الفعلي للكاريوكي أو الترجمة أو المزامنة، ستعرف أنها تنجرف وتنجذب إلى حدود خاطئة، وأحيانًا تهلوس فواصل كلمات غير موجودة. يشرح هذا الحديث السبب في حدوث ذلك على المستوى المعماري وما يمكنك فعله بواقعية حيال ذلك.
النسخة المختصرة: فك التشفير Transformer من النهاية إلى النهاية المدرب مع الإنتروبيا المتقاطعة محسّن للتنبؤ بالرمز التالي، وليس لمحاذاته في الوقت المناسب. أوزان الانتباه المتقاطع وحيل قائمة على DTW هي هيوريستيكات على نموذج لم يتعلم قط المحاذاة كهدف من الدرجة الأولى. تستكشف الجولة بعد ذلك الإصلاحات المعروضة — أدوات معالجة بعدية هيوريستية (غير معايرة في الغالب وينبغي تجنبها)، والمحاذاة القسرية المستندة إلى الهاتف (أفضل لكنها تتطلب قاموس النطق وحساب إضافي)، والنهج الهجينة التي تجمع النص المنقول من Whisper مع نموذج CTC أو محاذاة قسرية. إذا كنت تشحن أي منتج حيث يهم التوقيت — الترجمات أو المزامنة أو تحرير الصوت أو تحليلات الكلام — فهذا السياق ضروري قبل أن تثق في طوابع Whisper الزمنية في الإنتاج.
