مراجعة VALL-E 2 من Microsoft (تحقيق التكافؤ البشري في TTS بدون تدريب)
TTS بدون تدريب عبر للتو خطاً يعتقد الكثيرون أنه لا يزال سنوات بعيداً: VALL-E 2 من Microsoft هو أول نموذج لغة ترميز عصبي يحقق التكافؤ البشري على كل من LibriSpeech…
فهم VALL-E 2 من Microsoft في 3 دقائق (تحقيق التكافؤ البشري في TTS بدون تدريب)
وقت قصير لكن تحتاج إلى معرفة لماذا أصبحت VALL-E 2 فجأة نقطة المرجع لـ TTS بدون تدريب؟
مراجعة DiTAR: نمذجة Diffusion Transformer الانحدارية التلقائية لتوليد الكلام ~ Seed-TTS
فريق Seed-TTS عاد مع DiTAR، وهي إجابة نظيفة على أحد المقايضات الأكثر حرجاً في توليد الكلام الحديث: كيف تحافظ على مرونة التمثيلات الكلامية المستمرة دون دفع تكلفة
مراجعة Seed-TTS من ByteDance/Tiktok: عائلة من نماذج توليد الكلام متعددة الاستخدامات عالية الجودة
Seed-TTS من ByteDance هي واحدة من أقوى الإشارات حتى الآن بأن TTS تتخرج من مكون إلى نموذج أساسي حقيقي.
من Whisper OpenAI إلى خدمة ASR الخاصة بك: التعرف على الكيانات الاسمية والمصطلحات الخاصة بالمجال
Whisper خارج الصندوق مثير للإعجاب، لكن أي شخص قام فعلاً بنشره في الإنتاج يعرف الألم: فهو يخطئ في الأسماء الصحيحة، وأسماء المنتجات، والمصطلحات الطبية، والمصطلحات…
Movie Gen من Meta مقابل Sora من OpenAI: مراجعة تفصيلية
أخيراً كشفت Meta عن يدها ضد Sora، و Movie Gen هو أكثر من مجرد مولد فيديو — إنه مجموعة من نماذج الأساس التي تنتج فيديو HD بدقة 1080p عبر نسب عرض متعددة مع صوت مت…
تحليل الباحث من Google المتعمق حول الكلام من طرف إلى طرف، الجزء 1: النظرة العامة والنمذجة
قلل عقد من التعلم العميق معدلات أخطاء كلمات ASR بأكثر من 50 في المئة نسبة، وفي هذه العملية، جعل خطوط أنابيب HMM الكلاسيكية تبدو مثل التراث.
استنتاج معمارية الشبكة العصبية لـ OpenAI GPT-4o
لم تنشر OpenAI ورقة عن GPT-4o، لذا يفعل هذا الفيديو الشيء التالي الأفضل: فهو يقوم بهندسة عكسية لمعمارية الشبكة العصبية التي تبدو أنها بالتأكيد ستكون بناءً على ا…
نموذج Google للكلام العام لـ 100+ لغة يتفوق على نموذج OpenAI Whisper
أنجزت نموذج Google للكلام العام بهدوء شيئاً رائعاً: طابقت أو تفوقت على Whisper من OpenAI في ASR عبر أكثر من 100 لغة مع استخدام ما يقرب من سُبع البيانات المسمى الم…
مراجعة طويلة: MM1 من Apple: الطرق والتحليل والرؤى من التدريب المسبق للنموذج اللغوي متعدد الأنماط
Apple لا تنشر الكثير، لذا عندما ظهرت ورقة MM1 مع دراسة استئصالية كاملة عن التدريب المسبق للنموذج اللغوي متعدد الأنماط، كانت من أكثر إصدارات البيانات المفيدة في…
مراجعة سريعة لـ MM1: نموذج Apple اللغوي متعدد الأنماط SOTA
إذا لم يكن لديك وقت للتفصيل الكامل لـ MM1، فإن هذه المراجعة السريعة تعطيك الأساسيات في بضع دقائق: ما الذي بنته Apple، وماذا تعلموا من الدراسات الاستئصالية على …
السر الذي جعل Claude 3 يتفوق على GPT-4
عندما تفوق Claude 3 Opus على GPT-4 في MMLU و GPQA و GSM8K ومعظم مقاييس التقييم الحدودية، لم يكن السؤال المثير للاهتمام هو ما إذا كانت Anthropic قد قامت ببساطة …
نماذج الذكاء الاصطناعي التوليدية المتعلقة بـ Sora: Normalizing Flows
يتحدث الجميع عن diffusion، لكن إذا كنت تريد فعلاً أن تفهم الشجرة العائلية التي أنتجت Sora والفيديو التوليدي الحديث، فعليك أن تقضي بعض الوقت مع normalizing flows…
محلل التشفير المتغير (VAE) وخدعة إعادة المعاملة - إعادة النظر في نموذج التوليد الكلاسيكي
قبل الانتشار، قبل تدفقات التطبيع، قبل نماذج الانتشار الكامنة التي بنت بهدوء ترميزات VAE في كل مكدس توليدي جدير بالاهتمام — كانت هناك ورقة Kingma و Welling لعام…
مراجعة نماذج الكلام الكبيرة مفتوحة المصدر من Microsoft+OpenAI و Google و Meta و Nvidia لـ ASR
لقد قامت كل مختبر ذكاء اصطناعي رئيسي الآن بشحن نموذج كلام كبير مفتوح المصدر لـ ASR، وأصبح اختيار النموذج الصحيح للإنتاج قراراً حقيقياً.
[قراءة ورقة مفصلة] Zipformer: ترميز أسرع وأفضل للتعرف التلقائي على الكلام
لقد كان Conformer هو ترميز ASR الافتراضي لسنوات، لكن Zipformer من فريق k2/icefall أخذ بهدوء تاج WER على LibriSpeech و Aishell-1 و WenetSpeech بينما يكون أسرع و…
Tycho: أداة لبناء خدمات الكلام الخاص عالية ROI (ASR/TTS/Translation): نظرة عامة
معظم الفرق التي تريد خدمة ASR أو TTS أو ترجمة كلام الخاص تواجه نفس الاختيار الفوضوي: لصق أجزاء من ESPnet و NeMo و k2 و HuggingFace معاً، أو تسليم كل شيء إلى واج…
من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: المعالجة اللاحقة والنمذجة اللغوية
مخرجات Whisper الخام مثيرة للإعجاب خارج الصندوق، لكن أي شخص قام بنشرها لدى مستخدمين حقيقيين يعرف الفجوة بين نسخة توضيحية وشيء يمكن لنظام المعالجة اللاحقة أن يس…
من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: الصوت الطويل والبث المباشر (الجزء 3)
تم تدريب Whisper على أجزاء مدتها 30 ثانية، وهذا يظهر عندما تطعمه بودكاست لمدة ساعتين أو تحاول ربطه بخط أنابيب الترجمة المباشرة.
من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: العائد على الاستثمار (الجزء 2)
عادة ما يتم طرح سؤال البناء مقابل الشراء بخصوص ASR كمسألة دقة مقابل الراحة، لكن العامل الحقيقي المحدد هو العائد على الاستثمار على مدى عمر المنتج.
من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: نظرة عامة (الجزء 1)
عندما فتحت OpenAI مصدر Whisper، أعادت بهدوء تعيين خط الأساس لما تبدو عليه خدمة ASR الخاصة.
لماذا الطوابع الزمنية للكلمات التي ينتجها OpenAI Whisper غير دقيقة؟ كيف تجعلها دقيقة مرة أخرى؟
اطلب من Whisper طوابع زمنية للكلمات وستحصل على أرقام — لكن إذا حاولت يومًا ما محاذاتها مع الصوت الفعلي للكاريوكي أو الترجمة أو المزامنة، ستعرف أنها تنجرف وتنجذب…
الذكاء الاصطناعي التوليدي للكلام: VoiceBox من Meta AI (أيضًا Flow Matching و Neural ODE)
لسنوات عديدة، تخلف توليد الكلام عن توليد النص والصور من حيث النطاق والعمومية — حصلت كل مهمة على نموذج مخصص بها.
I-JEPA: نموذج العالم الأول من Yann LeCun لرؤية الحاسوب
Yann LeCun جادل لسنوات بأن الاستدراج التوليدي هو الرهان الخاطئ لبناء آلات تفهم العالم.
LoRA: السماح لطالب في المدرسة الثانوية بتدريب نموذج اللغة الكبيرة (GPT-3) بطاقة رسومات ألعاب
الضبط الدقيق الكامل لـ GPT-3 بـ 175 مليار معامل هو نقطة عدم البدء لجميع الناس تقريبًا — التخزين وحده يستبعده، ناهيك عن بطاقات الرسومات.
مراجعة SpeechT5: إدخال T5 من Google إلى مهام الكلام (ASR, TTS, SID, ...)
وحّد T5 مهام النص إلى النص تحت وصفة تدريب مسبق واحدة للمشفر-فك الشفرة وأصبح حصان العمل في NLP.
مراجعة WaveNet من DeepMind لتوليف TTS/الصوت (هل يبدو لك مثل GPT؟)
قبل Tacotron، قبل VALL-E، قبل أن تحول الأكوديكات العصبية الصوت إلى رموز، كانت ورقة WaveNet من DeepMind هي التي أظهرت أن الشبكات العصبية يمكنها إنشاء أشكال موجا…
مراجعة HiFi-GAN: الشبكات العدائية التوليدية لتوليف الكلام الفعال والعالي الدقة
لفترة طويلة، فرضت المحللات الصوتية العصبية عليك الاختيار بين جانبين: أعطتك نماذج الانحدار الذاتي مثل WaveNet صوتًا جميلًا لكنه بطيء بشكل مؤلم، بينما كانت مولدات …
مراجعة متعمقة لـ SoundStream من Google: أكوديك صوتي عصبي من النهاية إلى النهاية
أصبحت الأكوديكات العصبية بهدوء الطبقة الأساسية للصوت التوليدي الحديث، و SoundStream هي إحدى الأوراق الرائدة في هذا المجال.
الكشف عن نموذج رؤية+نص OpenAI GPT-4 والبيانات وتكلفة التدريب (متكهن بها)
رفضت OpenAI بشهرة الكشف عن هندسة معمارية GPT-4 وعدد المعاملات وبيانات التدريب أو ميزانية الحوسبة، مما حول التقرير التقني إلى اختبار Rorschach لمجتمع ML.
