[Short Review] Conformer: Convolution-augmented Transformer for Speech Recognition

Tutorials

[مراجعة قصيرة] Conformer: Transformer معزز بالالتفاف للتعرف على الكلام

استحوذ Conformer على عالم ASR بقوة عاصفة بفعل شيء بسيط تقريباً: إضافة وحدة التفاف إلى كل كتلة Transformer بحيث يلتقط النموذج السياق العام والتفاصيل الصوتية المحلية في خطوة واحدة.

استحوذ Conformer على عالم ASR بقوة عاصفة بفعل شيء بسيط تقريباً: إضافة وحدة التفاف إلى كل كتلة Transformer بحيث يلتقط النموذج السياق العام والتفاصيل الصوتية المحلية في خطوة واحدة. كانت النتيجة فائقة، WER 2.1%/4.3% على LibriSpeech بدون نموذج لغة، وأصبح الآن العمود الفقري الافتراضي لجزء ضخم من أنظمة الكلام الإنتاجية.

تركز هذه المراجعة القصيرة من ورقة Gulati et al. على الأساسيات، ما تبدو عليه بنية macaron feed-forward، لماذا تهم وحدة التفاف، وكيف أن المتغير الصغير بمعاملات 10M لا يزال يحقق نتائج WER تنافسية بنسبة 2.7%/6.3%. إنها أسرع طريقة لفهم الموضوع إذا استمررت تشاهد Conformer في NeMo أو ESPnet أو لوحات المتصدرين وتريد معرفة سبب كل هذا الجدل حوله. تستحق مشاهدة سريعة قبل أن تنغمس في الورقة الكاملة.