مراجعة VALL-E 2 من Microsoft (تحقيق التكافؤ البشري في TTS بدون تدريب)
TTS بدون تدريب عبر للتو خطاً يعتقد الكثيرون أنه لا يزال سنوات بعيداً: VALL-E 2 من Microsoft هو أول نموذج لغة ترميز عصبي يحقق التكافؤ البشري على كل من LibriSpeech…
فهم VALL-E 2 من Microsoft في 3 دقائق (تحقيق التكافؤ البشري في TTS بدون تدريب)
وقت قصير لكن تحتاج إلى معرفة لماذا أصبحت VALL-E 2 فجأة نقطة المرجع لـ TTS بدون تدريب؟
ما الذي يجعل خط أنابيب تنظيف بيانات الكلام من Olewave فعالاً وفريداً من نوعه
كيف يحول خط أنابيب Olign من Olewave الصوت الخام إلى بيانات تدريب ASR/TTS جاهزة للإنتاج — نصوص محققة، طوابع زمنية على مستوى الكلمة، ودرجات ثقة، بدون مصنفين بشري…
من Whisper OpenAI إلى خدمة ASR الخاصة بك: التعرف على الكيانات الاسمية والمصطلحات الخاصة بالمجال
Whisper خارج الصندوق مثير للإعجاب، لكن أي شخص قام فعلاً بنشره في الإنتاج يعرف الألم: فهو يخطئ في الأسماء الصحيحة، وأسماء المنتجات، والمصطلحات الطبية، والمصطلحات…
تحليل الباحث من Google المتعمق حول الكلام من طرف إلى طرف، الجزء 1: النظرة العامة والنمذجة
قلل عقد من التعلم العميق معدلات أخطاء كلمات ASR بأكثر من 50 في المئة نسبة، وفي هذه العملية، جعل خطوط أنابيب HMM الكلاسيكية تبدو مثل التراث.
نموذج Google للكلام العام لـ 100+ لغة يتفوق على نموذج OpenAI Whisper
أنجزت نموذج Google للكلام العام بهدوء شيئاً رائعاً: طابقت أو تفوقت على Whisper من OpenAI في ASR عبر أكثر من 100 لغة مع استخدام ما يقرب من سُبع البيانات المسمى الم…
مراجعة طويلة: MM1 من Apple: الطرق والتحليل والرؤى من التدريب المسبق للنموذج اللغوي متعدد الأنماط
Apple لا تنشر الكثير، لذا عندما ظهرت ورقة MM1 مع دراسة استئصالية كاملة عن التدريب المسبق للنموذج اللغوي متعدد الأنماط، كانت من أكثر إصدارات البيانات المفيدة في…
مراجعة سريعة لـ MM1: نموذج Apple اللغوي متعدد الأنماط SOTA
إذا لم يكن لديك وقت للتفصيل الكامل لـ MM1، فإن هذه المراجعة السريعة تعطيك الأساسيات في بضع دقائق: ما الذي بنته Apple، وماذا تعلموا من الدراسات الاستئصالية على …
السر الذي جعل Claude 3 يتفوق على GPT-4
عندما تفوق Claude 3 Opus على GPT-4 في MMLU و GPQA و GSM8K ومعظم مقاييس التقييم الحدودية، لم يكن السؤال المثير للاهتمام هو ما إذا كانت Anthropic قد قامت ببساطة …
مراجعة نماذج الكلام الكبيرة مفتوحة المصدر من Microsoft+OpenAI و Google و Meta و Nvidia لـ ASR
لقد قامت كل مختبر ذكاء اصطناعي رئيسي الآن بشحن نموذج كلام كبير مفتوح المصدر لـ ASR، وأصبح اختيار النموذج الصحيح للإنتاج قراراً حقيقياً.
[قراءة ورقة مفصلة] Zipformer: ترميز أسرع وأفضل للتعرف التلقائي على الكلام
لقد كان Conformer هو ترميز ASR الافتراضي لسنوات، لكن Zipformer من فريق k2/icefall أخذ بهدوء تاج WER على LibriSpeech و Aishell-1 و WenetSpeech بينما يكون أسرع و…
من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: المعالجة اللاحقة والنمذجة اللغوية
مخرجات Whisper الخام مثيرة للإعجاب خارج الصندوق، لكن أي شخص قام بنشرها لدى مستخدمين حقيقيين يعرف الفجوة بين نسخة توضيحية وشيء يمكن لنظام المعالجة اللاحقة أن يس…
من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: الصوت الطويل والبث المباشر (الجزء 3)
تم تدريب Whisper على أجزاء مدتها 30 ثانية، وهذا يظهر عندما تطعمه بودكاست لمدة ساعتين أو تحاول ربطه بخط أنابيب الترجمة المباشرة.
من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: العائد على الاستثمار (الجزء 2)
عادة ما يتم طرح سؤال البناء مقابل الشراء بخصوص ASR كمسألة دقة مقابل الراحة، لكن العامل الحقيقي المحدد هو العائد على الاستثمار على مدى عمر المنتج.
من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: نظرة عامة (الجزء 1)
عندما فتحت OpenAI مصدر Whisper، أعادت بهدوء تعيين خط الأساس لما تبدو عليه خدمة ASR الخاصة.
لماذا الطوابع الزمنية للكلمات التي ينتجها OpenAI Whisper غير دقيقة؟ كيف تجعلها دقيقة مرة أخرى؟
اطلب من Whisper طوابع زمنية للكلمات وستحصل على أرقام — لكن إذا حاولت يومًا ما محاذاتها مع الصوت الفعلي للكاريوكي أو الترجمة أو المزامنة، ستعرف أنها تنجرف وتنجذب…
الذكاء الاصطناعي التوليدي للكلام: VoiceBox من Meta AI (أيضًا Flow Matching و Neural ODE)
لسنوات عديدة، تخلف توليد الكلام عن توليد النص والصور من حيث النطاق والعمومية — حصلت كل مهمة على نموذج مخصص بها.
مراجعة SpeechT5: إدخال T5 من Google إلى مهام الكلام (ASR, TTS, SID, ...)
وحّد T5 مهام النص إلى النص تحت وصفة تدريب مسبق واحدة للمشفر-فك الشفرة وأصبح حصان العمل في NLP.
[مراجعة Olewave] AudioLM: نهج لنمذجة اللغة لتوليد الصوت
AudioLM هي الورقة البحثية التي أقنعت الكثيرين بأن توليد الصوت يجب أن يبدو أكثر مثل نمذجة اللغة من معالجة الإشارات.
[10 mins] اشرح لماذا Whisper API من OpenAI ليس جيدًا مثل ChatGPT
حقق Whisper نجاحًا كبيرًا، لكنه لم يعيد تشكيل ASR بالطريقة التي أعادت بها GPT-3 تشكيل NLP، وتجادل هذه المراجعة لمدة عشر دقائق بأن الأسباب مدمجة في الورقة البحثية…
مراجعة متعمقة في GPT-3 من OpenAI: نماذج اللغة تتعلم من عينات قليلة (الجزء 1/3: المقدمة والنهج)
يعرض الجزء الأول من هذه المراجعة الثلاثية الأجزاء لـ GPT-3 الورقة التي حولت التوسع من رهان بحثي إلى حقيقة مسلمة في الصناعة.
مراجعة متعمقة لـ VALL-E: نماذج ترميز اللغة العصبية هي مركبات نص إلى كلام بدون عينة
بدت فكرة نقل TTS بدون عينة من مقطع مرجعي مدته ثلاث ثواني بعيدة المنال حتى وصلت VALL-E، وتفكك هذه المراجعة المتعمقة بالضبط كيفية تحقيق Microsoft لذلك.
فهم VALL-E من Microsoft في 3 دقائق (SOTA Zero-shot TTS)
VALL-E هي اللحظة التي توقف فيها TTS عن الظهور مثل انحدار الإشارة وبدأ يبدو مثل نمذجة اللغة، وهذا الشارح السريع يسرع لك الوصول بسرعة.
[Olewave's Review] وسم المتسلسلات على مستوى الرمز لـ SLU باستخدام نماذج E2E التركيبية
يشهد SLU الشامل رواجاً الآن، لكن معاملة وسم المتسلسلات كتنبؤ متسلسل ترمي بعيداً بصمت عقوداً من آلية الوسم المعروفة جيداً على مستوى الرمز.
[مراجعة Olewave] Branchformer: معماريات MLP-Attention المتوازية، و E-Branchformer
كان Conformer هو مشفر ASR الذي يجب التغلب عليه لسنوات، لكن Branchformer و تابعه E-Branchformer يقدمان حالة مقنعة بأن sequential conv-plus-attention ليس هو المس…
إضافة عدم التصادم في الأخطاء اللفظية (NCMA) للتعرف على الكلام باللهجة
كلام بلهجة والكلام غير الأصلي يكسران قاموس النطق بطرق تسمم بهدوء محاذاة نموذجك الصوتي، وهذا البحث من Interspeech 2021 يطرح سؤالاً بسيطاً ظاهرياً: ماذا لو أضفنا فقط
[مراجعة Olewave] Whisper ASR من OpenAI: التعرف المتين على الكلام من خلال الإشراف الضعيف على نطاق واسع
عندما أطلقت OpenAI Whisper، اضطر مجتمع ASR للتعامل مع نظام تم تدريبه على 680,000 ساعة من الصوت متعدد اللغات ومتعدد المهام ومجمع من الويب، وقد عمل بشكل جيد مباش…
أكثر توضيح تفصيلي من Olewave لـ RNN-T: Sequence Transduction with Recurrent Neural Networks
ورقة RNN-T الخاصة بـ Alex Graves هي السلف الهادئ لكل نظام ASR للبث يتم شحنه اليوم، من معرف Google على الجهاز إلى عدد لا يحصى من مكدسات transducer مفتوحة المصدر…
[مراجعة Olewave الطويلة] التدريب الفعّال لـ Neural Transducer للتعرف على الكلام
محولات Neural هي حصان العمل في ASR للبث، لكن تدريبها بكفاءة مشهور بأنه مؤلم: خسارة RNN-T لديها ذاكرة مكعبة في طول التسلسل، وشبكة المحاذاة تنفجر على الكلام الطو…
[مراجعة طويلة] Conformer: Transformer معزز بالالتفاف للتعرف على الكلام
Conformer هو النموذج الذي استحوذ بهدوء على ASR من النهاية إلى النهاية، وصيغته، وضع وحدة التفاف على كل كتلة Transformer، تبين أنها واحدة من تلك الأفكار البسيطة …
