واحد-تحرير-مسافة FSA/Network-based (OEDN) في كشف الأخطاء اللفظية والتعرف على الكلام باللهجة
تحتوي النمذجة الصوتية غير الأصلية على مشكلة الدجاجة والبيضة: محاذاات الهاتف السيئة تنتج نماذج سيئة، والنماذج السيئة تنتج محاذاات سيئة.
تحتوي النمذجة الصوتية غير الأصلية على مشكلة الدجاجة والبيضة: محاذاات الهاتف السيئة تنتج نماذج سيئة، والنماذج السيئة تنتج محاذاات سيئة. هذا الحديث عن نهج One-Edit-Distance FSA/Network-based (OEDN) يكسر هذه الحلقة باستخدام فاك شيفرة الهاتف المقيد للتعرف على سلسلة النطق الأكثر احتمالاً ضمن مسافة تحرير واحدة من النطق الكنسي، ثم تكرار الكشف والتعرف حتى لا تظهر أخطاء لفظية أخرى.
على مجموعة نصية غير أصلية عفوية مدتها 300 ساعة، قام النموذج الصوتي الناتج بحذف 6٪ من WER مقابل خط أساس HMM بـ TDNN المحسوب المعتمد على السياق المضبوط بشكل جيد مع طوبولوجيا عصبية متطابقة، وهي ليست نقطة دلتا صغيرة على هذا المقياس. بعيداً عن الفوز بالدقة، يُسقط خط الأنابيب فهرساً مستخرجاً من البيانات من أنماط الأخطاء اللفظية الشائعة من متعلمي اللغة الإنجليزية غير الأصليين، وهو مفيد بشكل مباشر لمنتجات تقييم الكلام وتسجيل النطق. يشرح الحديث كيف تقود درجات جودة النطق الكشف الأولي، وكيف يحافظ قيد مسافة التحرير الواحدة على البحث قابل للتتبع، وكيف يحسن التكرار المتكرر المحاذاات حتى التقارب. إذا كنت تعمل على ASR ملهج أو تدريب النطق بمساعدة الحاسوب، أو أي مهمة نمذجة صوتية حيث يكذب القاموس عليك، فاضغط على التشغيل للحصول على وصفة ملموسة وقابلة للتكرار.
