野生データを活用した高ROIの音声R&Dの実現—当社のICASCP 2024スポットライト
当社の創業者兼CEOであるWei Chuは、ICASCP 2024のスポットライトトークで、従来の音声サービス開発が低ROIである理由と、大規模なオープンソース音声モデルを使用してワイルドデータをフィルタリングし、プライベートデータを自動ラベル付けすることで状況を逆転させる方法について説明しました。
ソウルのIEEE ICASSP 2024で、当社の創業者兼CEOWei Chuは、エンタープライズ音声R&Dを劇的に安くしている変化についてのスポットライトトークを行いました。人間のラベル付けとオフザシェルフのデータセットに支払いをやめ、野生データとオープンソース基礎モデルを活用し始めます。
従来の音声サービスビルドがなぜ低ROIなのか
音声AIを構築するすべてのエンタープライズは、同じ3つの魅力的なショートカットに直面しています。各1つは隠されたROI上限があります。
クラウドAPIを呼び出す 構築が速く、R&Dコストが非常に小さいです。ただし、製品にカスタマイズできない、特定のデータのパフォーマンスが不満足、スケール時に高価、すべてのリクエストは潜在的なデータ漏洩ベクトルです。
ベンダーから購入する 紙の上ではDIYより安いです。実際には:データシステムベンダーからの大きな請求書、社内通信オーバーヘッドのためのサブパフォーマンス、およびそれでもデータ漏洩リスク。
テック巨人のようにDIYする (Alexa、Siri、Google Voice Search) 自社スタック、完全なデータ安全—および、出荷する前にR&Dチーム、データキュレーション、インフラストラクチャの5年間の10億ドルの投資。
他の「安い」選択肢は良くありません。海外契約チーム、オフシェルフシミュレートされたデータセット、または苦労している起業を獲得すると、すべて現金を節約するためにROIを犠牲にします。
高ROI代替案—大規模音声モデルの肩に立つ
2つのシフトがOlewaveのアプローチを支えます。
スケーリング法則に乗る。 2022年以来、テック大手はCC-BYの大規模音声モデル—Whisper、SeamlessM4Tなど—をオープンソース化しています。もう車輪を再発明する必要はありません。ファインチューンスクラッチからのトレーニングの代わりにニッチへの基礎モデル。これにより、ほぼすべてのR&Dチーム、データキュレーション、トレーニング基盤支出を排除します。
フィルタワイルドデータと自動ラベルプライベートデータ。 フィルター処理されたワイルドデータ—AI駆動のラベル付けシステムによって生成された検証済みトランスクリプション、タイムスタンプ、トピックタグ—はドメインモデルを微調整するために使用されます。そのドメインモデルは、信頼度スコア付きで独自のデータにラベルを付けます。人間のラベラーはいません。インフラストラクチャを離れるデータはありません。違反リスクはありません。事前にシミュレートされたデータセットの請求書なし。
当社の4ステップのオーダーメイドラベル付けパイプライン
- ジャンプスタート—クライアントと同じドメインからのワイルドデータを選択し、大規模な音声/言語基礎モデルからドメインモデルを微調整します。
- 自動ラベル—ドメインモデルは、単語ごと、発話ごとの信頼度スコア付きでクライアントの独自データにラベルを付けます。人間のラベラーは必要ありません。したがって、データ漏洩のリスクもありません。
- 反復的に学習—ラベル付きプライベートおよびパブリックデータのセットをコンパイルし、ドメインモデルを再度微調整し、改善されたバージョンでプライベートデータにラベルを再度付けます。品質が安定するまで繰り返します。
- 準備完了—品質が十分な場合は反復を停止します。Tycho SDKを許諾して、自身のインフラストラクチャ上でラベル付けと構築を継続できます。
なぜこれが重要なのか
- 人間のラベラーなしでドメイン固有のモデルの教師ありトレーニング—エンタープライズ音声プロジェクトの最大の経常コスト。
- データ漏洩リスクがない—プライベートデータがお客様の環境を離れることはありません。
- 大幅に低いラベル付けコスト—モデルが仕事をします。人間はエッジケースをレビューします。
- 同じファインチューンワークフロースケールは、製品が成熟するにつれて新しいドメイン、言語、ユースケースに対応します。
当社に連絡する
音声AI製品のビルドとバイを評価しているか、既存の1つでデータラベル付けの支出を削減しようとしている場合、メモを比較したいと思います。
[email protected]にメールするか、ウェブサイト経由でご連絡ください—営業日以内に応答します。
