ICASSP 2024でのOlewave
私たちはソウルで開催されたIEEE ICASSP 2024のパトロンおよび展示者でした。創業者兼CEOのWei Chuは、野生データやウェブから取得したデータから音声モデルを訓練することについてのスポットライトトークを行いました。
今年の主要な信号処理会議のスポンサー
OlewaveはソウルのIEEE ICASSP 2024のパトロンおよび展示者でした。Meta、Google、Samsung、Apple、ByteDance、Adobe、MathWorksおよび他の多くの企業とともに。完全なパトロンリストを参照してください→
私たちのブースに立ち寄って、音声、データ、音声AIについて話し合ってくれたすべての人に感謝します。
当社の創業者兼CEOによるスポットライトトーク
OlewaveのCEO兼創業者であるWei Chuは、会議中にスポットライトトークを行いました。
カスタマイズされた音声関連サービスの費用対効果の高い開発のための野生で手に負えないデータの活用
要約。 最近、ウェブから取得した大規模な音声データセットで訓練されたモデルが、従来の人間がラベル付けされたまたはシミュレートされた音声データセットよりも優れた精度を達成でき、潜在的にコストが低くなる可能性があることを発見しました。カスタマイズ可能なAI駆動のデータラベリングシステムを開発しました。信頼度スコア付きの単語レベルのトランスクリプションを推測し、教師ありASRトレーニングを可能にします。また、トランスクリプションまたは認識エラーが存在する場合でも、電話レベルのタイムスタンプを堅牢に生成し、TTSモデルのトレーニングを促進します。さらに、シナリオ、アクセント、言語、トピックタグなどのラベルをデータに自動的に割り当て、タスク固有のデータを選択して、その特定のタスク向けにカスタマイズされたモデルをトレーニングできます。
WhisperおよびSeamlessM4Tなどのオープンソース大規模音声モデルを微調整し、結果のメトリクスを分析することで、データセットの効果を評価しました。公開利用可能なデータに加えて、私たちのデータ処理システムは、特定の垂直ドメインからの独自データに信頼できるラベルを提供するようにカスタマイズできます。人間のラベラーなしでドメイン固有のモデルの教師あり訓練を可能にし、データ漏洩リスクを排除し、ラベル付けコストを大幅に削減します。
私たちが展示したもの
音声データセット
- 大規模—最大数百万時間
- 現実世界のシナリオ—会議、通話、トーク、自然な会話
- 単語および発話レベルの信頼度を備えた検証済み逐語録
- 多言語および多地域—ブラジルポルトガル語、ラテンアメリカスペイン語、アラビア語、東南アジア言語、中国語、日本語、韓国語を積極的に収集しています
- 多様なトピック—ファッション、エンターテイメント、ヘルスケアなど
ASRを超えて、私たちはまた会議の要約、音声合成と音声クローニング、および自分のモデルをベンチマークするための評価のみセット用のコーパスを作成しています。私たちは、現実的な音声とトーキングヘッド合成のために高忠実度オーディオ/ビデオを提供しています。
独自のデータラベル付けのためのオーダーメイドソリューション
当社の4ステップパイプラインにより、人間のラベラーに公開することなく、機密データをラベル付けできます。
- ジャンプスタート—あなたのドメインと一致するドメインからのワイルドデータを選択し、大規模な音声/言語基礎モデルからドメインモデルを微調整します。
- 自動ラベル—ドメインモデルは、信頼度スコア付きでクライアントの独自データにラベルを付けます。人間のラベラーは必要ありません。データ漏洩のリスクがありません。
- 反復的に学習—ラベル付きプライベートおよびパブリックデータのセットをコンパイルし、ドメインモデルを再度微調整し、改善されたバージョンでプライベートデータにラベルを再度付けます。品質が安定するまで繰り返します。
- 準備完了—品質が安定したら、Tycho SDKを許諾して、自身のインフラストラクチャ上でラベル付けと構築を継続できます。
Tycho—自社音声サービス向けのSDK
Tychoは、高ROIの自社音声製品を構築するチーム向けにICASCPで展示したSDKです。
- 常にモデルの精度と推論速度の最先端
- トレーニング、微調整、評価、デプロイメントのサポート
- 利用可能なモデル:オンライン/オフラインASR、音声評価、音声クローニング—要リクエストで新しいモデルが利用可能
- コストを低く保つために、控え目なGPUワークステーションで実行
- すべてのトレーニング、微調整、評価、デプロイメントコードはクライアントに配信されます
競争力のあるサービスレート:
- 垂直ドメインモデルを最高品質に微調整する
- 深い悪いケース分析を通じて起動されたサービスを修正および改善する
- 音声R&Dプロジェクトに関するMLエンジニアのための実践的なトレーニング
Tychoはオープンソースではありません。ライセンス料金とサービス料金の見積もりを求めてください。
次回私たちを見つけてください
ソウルで私たちを逃した場合は、今年後半にさらに多くの会議に参加します。[email protected]でメールするか、ウェブサイト経由でご連絡ください—データセット、カスタムモデル、またはコンサルティング、私たちは営業日以内に応答します。
