我們榮幸地提供

Olewave現成語音數據集

高質量,
基於美國的透明度,
無與倫比的規模和經濟實惠。
  • 第一層—未轉錄:語言和主題標籤(加上可選的SNR、語音比率、摘要)。

  • 第二層—偽轉錄:第一層標籤+帶有詞級和語句級時間戳和置信度分數的機器轉錄。

  • 第三層—HITL轉錄:第一層標籤+根據第二層標準驗證的人工製作轉錄。

  • 第四層—高級標籤:最全面—第三層+說話者轉換、說話者分離、主題和自定義註釋。

  • 企業就緒和經濟實惠:堅實的SLA·AB 2013合規·端到端審計跟踪·比傳統數據集便宜最多10倍

索取目錄

語音數據處理和清理服務API

將您的原始音頻
轉變為用於訓練和評估的生產就緒數據,
使用我們的OTS級管道。
  • 清理:移除噪聲、靜音、重複和不相關的片段

  • 註釋:自定義模型生成準確的首遍標籤,然後人工審核員驗證和優化以獲得生產級質量

  • 驗證:我們的專有驗證捕捉註釋錯誤

  • 策劃:我們甚至可以從您指定的來源收集

  • 安全:通過限制人工介入來最小化數據洩露風險

  • 交付:您的數據、您的格式、在您的基礎設施上

預訂免費諮詢

開源對話語音數據集

OleSpeech-IV-2025-EN-AR-100
英語對話音頻,
驗證的轉錄和說話者轉換,
免費供研究使用。
  • 來源:播客、談話節目、電話會議、自然對話

  • 轉錄驗證:詞級置信度分數,無幻覺

  • 轉錄修正:命名實體的專有方法—名稱、組織、位置、時間

  • 精細計時:詞級和音素級時間戳,帶有說話者轉換

  • 360°註釋:說話者姓名、轉換、SNR、主題、描述

  • 標籤自定義:從預標籤中選擇或請求新的

  • 終身策劃:以無額外成本持續優化標籤

  • 由Olign製作:我們的專有語音轉文本對齊引擎

  • 完整數據集可供購買:聯繫我們以獲得商業許可

在Hugging Face上查看

‡ 僅限美國公司和機構。需要簽署保密協議。