我々が誇るサービス

Olewave Over-The-Shelf音声データセット

高品質、
米国ベースの透明性、
比類のないスケール&コスト効率。
  • Tier I — トランスクリプション無し: 言語とトピックタグ(オプションでSNR、音声比率、要約など)。

  • Tier II — 疑似トランスクリプション: Tier Iラベル+単語と発話レベルのタイムスタンプと信頼スコアを備えた機械トランスクリプト。

  • Tier III — HITL-Transcribed: Tier Iラベル+Tier II標準に検証された人間が作成したトランスクリプト。

  • Tier IV — Advanced-Labeled: 最も包括的—Tier III +スピーカーターン、ダイアリゼーション、トピック、カスタムアノテーション。

  • エンタープライズ対応&コスト効率的: 厳固なSLA・AB 2013準拠・エンドツーエンド監査証跡・従来型データセットより最大10倍安い

カタログを要求

音声データ処理&クリーニングサービスAPI

生のオーディオを変換
トレーニングと評価用のプロダクション対応データに、
当社のOTSグレードパイプラインを使用。
  • クリーン: ノイズ、沈黙、重複、関連性のないセグメントを削除

  • アノテート: カスタムモデルが正確な最初のパスラベルを生成し、その後、人間のレビュアーがプロダクショングレードの品質で検証と改善を行います

  • 検証: 当社の専有検証は注釈エラーをキャッチします

  • キュレート: 指定されたソースからも収集できます

  • 安全: 人間関与を制限してデータ漏洩リスクを最小化

  • 配信: 貴社のデータ、貴社のフォーマット、貴社のインフラストラクチャで

無料相談を予約

オープンソース化された会話音声データセット

OleSpeech-IV-2025-EN-AR-100
英語会話オーディオ、
検証済みトランスクリプトとスピーカーターン、
研究用は無料。
  • ソース: ポッドキャスト、トークショー、テレカンファレンス、自然な会話

  • トランスクリプト検証: 単語レベルの信頼スコア、幻覚なし

  • トランスクリプト修正: 固有表現の専有方法—名前、組織、場所、時間

  • 細粒度タイミング: スピーカーターン付きの単語とフォネームレベルのタイムスタンプ

  • 360°アノテーション: スピーカー名、ターン、SNR、トピック、説明

  • ラベルカスタマイズ: プリラベルから選択するか、新しいラベルをリクエスト

  • 生涯キュレーション: 追加費用なしの継続的ラベル改善

  • Olignが製造: 当社の専有音声テキスト整列エンジン

  • フルデータセット購入可能: 商用ライセンスについてお問い合わせください

Hugging Faceで表示

‡ 米国ベースの企業および機関のみ。NDA署名が必要です。