Olewave at ICASSP 2024

Events

Olewave في ICASSP 2024

كنا رعاة وعارضين في IEEE ICASSP 2024 في سيول، وألقى مؤسسنا والمدير التنفيذي Wei Chu محادثة بارزة عن تدريب نماذج الكلام من البيانات البرية المأخوذة من الويب.

Olewave at ICASSP 2024

كانت Olewave رعاة وعارضين في IEEE ICASSP 2024 في سيول، إلى جانب Meta وGoogle وSamsung وApple وByteDance وAdobe وMathWorks والعديد من الآخرين. انظر القائمة الكاملة للرعاة →

شكراً لكل من توقف عند جناحنا للحديث عن الكلام والبيانات و voice AI.

محادثة بارزة من مؤسسنا والمدير التنفيذي

ألقى Wei Chu، مؤسس Olewave والمدير التنفيذي، محادثة بارزة خلال المؤتمر:

تسخير البيانات البرية والعنيفة لتطوير خدمات متعلقة بالكلام مخصصة وفعالة من حيث التكلفة

الملخص. اكتشفنا مؤخراً أن نماذج مدربة ببيانات كلام واسعة النطاق مأخوذة من الويب يمكن أن تحقق دقة أفضل وربما تكلفة أقل من مجموعات البيانات المسمى بشرياً أو محاكاة الكلام التقليدية. طورنا نظام وسم بيانات مدفوع بالذكاء الاصطناعي قابل للتخصيص. يستنتج نسخاً على مستوى الكلمة مع درجات الثقة، مما يسمح بتدريب ASR الخاضع للإشراف. كما أنه بقوة ينتج الطوابع الزمنية على مستوى الهاتف حتى في وجود أخطاء النسخ أو الاعتراف، مما يسهل تدريب نماذج TTS. علاوة على ذلك، فإنه يعين تلقائياً تسميات مثل السيناريو والنبرة وتسميات اللغة والموضوع للبيانات، مما يسمح باختيار البيانات الخاصة بالمهمة لتدريب نموذج مصمم لتلك المهمة بالذات.

قيّمنا فعالية المجموعات عن طريق ضبط دقيق لنماذج كلام كبيرة مفتوحة المصدر مثل Whisper و SeamlessM4T وتحليل المقاييس الناتجة. بالإضافة إلى البيانات المتاحة للجمهور، يمكن تخصيص نظام معالجة البيانات الخاص بنا لتوفير تسميات موثوقة لـ البيانات المملوكة من مجالات عمودية معينة — مما يسمح بتدريب الخاضع للإشراف لنماذج خاصة بالمجال دون موظفي وسم البيانات البشريين، مما يلغي مخاطر خرق البيانات، وتقلل بشكل كبير من تكلفة الوسم.

اعرض تفاصيل المحادثة على موقع ICASSP 2024 →

ما عرضناه

مجموعات بيانات الكلام

  • واسعة النطاق — حتى ملايين الساعات
  • سيناريوهات العالم الحقيقي — الاجتماعات والمكالمات والمحادثات والمحادثات الطبيعية
  • النسخ الحرفية المتحققة مع ثقة على مستوى الكلمة والمذكرة
  • متعدد اللغات ومتعدد المناطق — جمع البرتغالية البرازيلية والإسبانية في أمريكا اللاتينية والعربية ولغات جنوب شرق آسيا والصينية واليابانية والكورية بنشاط
  • مواضيع متنوعة — الموضة والترفيه والرعاية الصحية والمزيد

وراء ASR، ننتج أيضاً حاشية لـ تلخيص الاجتماعات و تركيب الكلام واستنساخ الصوت و مجموعات التقييم فقط لمقارنة نماذجك الخاصة. نسلم صوت/فيديو عالي الدقة لتركيب كلام و talking-head واقعي.

حلول مخصصة لوسم البيانات المملوكة

يسمح لك خط الأنابيب المكون من أربع خطوات بوسم البيانات الحساسة دون الكشف عنها لموظف وسم بشري:

  1. Jump Start — ضبط دقيق لنموذج مجال على بيانات برية من مجال يطابق مجالك، بدءاً من نموذج أساس كلام/لغة كبير.
  2. Auto Label — يقوم نموذج المجال بوسم بيانتك المملوكة بدرجات ثقة لكل كلمة ولكل مذكرة. لا حاجة إلى موظفي الوسم البشريين. لا توجد مخاطر خرق بيانات.
  3. Iteratively Learn — ادمج مجموعة من البيانات الخاصة والعامة المسومة، ضبط دقيق لنموذج المجال مرة أخرى، ثم أعد وسم بيانتك الخاصة باستخدام نسخة أفضل. كرر حتى تستقر الجودة.
  4. Good to Go — عندما تصل الجودة إلى مستوى ثابت، نرخص SDK Tycho الخاص بنا حتى تتمكن من الاستمرار في الوسم والبناء على البنية التحتية الخاصة بك.

Tycho — SDK الخاص بنا لخدمات الكلام الخاصة

Tycho هو SDK الذي عرضناه في ICASSP للفريق الذي يبني منتجات كلام عالية العائد الخاصة.

  • دائماً متطور تماماً في دقة النموذج وسرعة الاستدلال
  • دعم للتدريب والضبط الدقيق والتقييم والنشر
  • النماذج المتاحة: ASR متصلة/غير متصلة، تقييم الكلام، استنساخ الصوت — نماذج جديدة متاحة عند الطلب
  • يعمل على محطات عمل GPU متواضعة للحفاظ على التكلفة منخفضة
  • يتم تسليم جميع أكواد التدريب والضبط الدقيق والتقييم والنشر للعميل

أسعار الخدمة التنافسية لـ:

  • ضبط دقيق لنموذج مجالك العمودي إلى جودة ممتازة
  • إصلاح وتحسين الخدمة المطلقة من خلال تحليل الحالات السيئة العميق
  • تدريب عملي لمهندسي ML الخاصين بك على مشاريع speech R&D

Tycho ليست مفتوحة المصدر. اطلب منا اقتباس ترخيص ورسم خدمة.

تعال تجدنا في المرة القادمة

إذا فاتك وجودنا في سيول، سنكون في مؤتمرات أخرى لاحقاً هذا العام. أرسل لنا بريداً إلكترونياً على [email protected] أو تواصل عبر الموقع — مجموعات بيانات أو نماذج مخصصة أو استشارات، سنرد خلال يوم عمل واحد.