Olewave 在 ICASSP 2024
我們是 IEEE ICASSP 2024 在首爾的贊助商和參展商,我們的創始人兼 CEO Wei Chu 發表了一場關於從野生、網路來源資料訓練語音模型的聚焦演講。
年度領先訊號處理會議的贊助商
Olewave 是 IEEE ICASSP 2024 在首爾的贊助商和參展商,與 Meta、Google、Samsung、Apple、ByteDance、Adobe、MathWorks 等並肩。查看完整贊助商清單 →
感謝所有到我們展位談論語音、資料和語音 AI 的人。
由我們的創始人兼 CEO 的聚焦演講
Olewave 的創始人兼 CEO Wei Chu 在會議期間發表了聚焦演講:
利用野生和未馴化的資料進行定製語音相關服務的成本效益開發
摘要。 我們最近發現,使用從網路來源的大規模語音資料集訓練的模型可以實現比傳統人工標籤或模擬語音資料集更高的準確度,並且潛在成本更低。我們開發了一個可定製的 AI 驅動的資料標籤系統。它推導出具有置信度分數的詞級轉錄,實現監督 ASR 訓練。它還在轉錄或辨識錯誤存在的情況下穩健地生成電話級時間戳,促進 TTS 模型的訓練。此外,它自動分配情景、口音、語言和主題標籤等標籤到資料,使得能夠選擇特定任務的資料來訓練針對該特定任務的定製模型。
我們通過微調開源大型語音模型(如 Whisper 和 SeamlessM4T)並分析結果指標來評估資料集的有效性。除了開放可用的資料外,我們的資料處理系統可以定製,為特定垂直領域的 專有資料 提供可靠標籤——使得能夠在沒有人工標籤人員的情況下進行受監督的域特定模型訓練,消除資料洩露風險,並大幅降低標籤成本。
我們展示的內容
語音資料集
- 大規模——最多達到數百萬小時
- 真實世界情景——會議、通話、演講、自然對話
- 驗證逐字轉錄,具有詞級和話語級置信度
- 多語言和多地區——主動收集巴西葡萄牙語、拉丁美洲西班牙語、阿拉伯語、東南亞語言、中文、日語和韓語
- 多元主題——時尚、娛樂、醫療保健等
除了 ASR 之外,我們還製作會議摘要、語音合成和語音克隆以及評估專用集來為你自己的模型進行基準測試的語料庫。我們提供高保真音訊/視訊以實現逼真的語音和說話頭合成。
專有資料標籤的客製化解決方案
我們的四步流程讓你無需將敏感資料公開給人工標籤人員即可進行標籤化:
- 快速開始——在與用戶資料相同領域的野生資料上微調域模型,從大型語音/語言基礎模型開始。
- 自動標籤化——域模型使用置信度分數標籤用戶的專有資料。無需人工標籤人員。無資料洩露風險。
- 迭代學習——編譯一組標籤化的私有和公共資料,再次微調域模型,然後用改進版本重新標籤化你的私有資料。重複直到質量停滯。
- 準備好開始——當質量充分時停止迭代。我們授權我們的 Tycho SDK,以便你可以繼續在自己的基礎設施上標籤化和構建。
Tycho——我們用於自研語音服務的 SDK
Tycho 是我們在 ICASSP 展示的 SDK,適用於構建高投資回報率、自研語音產品的團隊。
- 始終在模型準確度和推論速度上最先進
- 支持訓練、微調、評估和部署
- 可用模型:線上/離線 ASR、語音評估、語音克隆——根據請求提供新模型
- 在適度 GPU 工作站上運行以保持成本低
- 所有訓練、微調、評估和部署代碼都提供給用戶
競爭性服務費率用於:
- 微調你的垂直領域模型以達到頂級質量
- 通過深度不良案例分析修復和改進已推出的服務
- 為你的 ML 工程師提供有關語音 R&D 項目的實踐培訓
Tycho 不是開源。向我們詢問許可費和服務費。
下次來找我們
如果你在首爾錯過了我們,今年晚些時候我們將參加更多會議。請發送電子郵件至 [email protected] 或通過網站聯繫——資料集、定製模型或諮詢,我們將在一個工作日內回復。
