Olewaveの音声データクリーニングパイプラインが効果的でユニークな理由
Olewaveの Olign パイプラインが生音声を本番対応のASR/TTSトレーニングデータに変換する方法—検証済みトランスクリプト、単語レベルのタイムスタンプ、信頼度スコア、人間によるラベル付けなし。
Olewaveの最先端でカスタマイズ可能な 音声データクリーニングパイプラインは、その 音声データ収集パイプラインとシームレスに統合され、一緒に Olewaveの音声データキュレーションパイプラインを形成しています。このエンドツーエンドシステムは、大規模で高品質、一貫性、およびコスト効率的な音声データセットを提供するために入念に設計されており、幅広いダウンストリームアプリケーションに対応しています。さらに、私たちは 大規模でコスト効率的な音声データセットを提供しており、複数の言語で利用でき、多様なトピックをカバーしています。
Olewaveの最先端でカスタマイズ可能な 音声データクリーニングパイプライン は、その 音声データ収集パイプラインとシームレスに統合され、一緒に Olewaveの音声データキュレーションパイプラインを形成しています。
下の図は、音声データクリーニングパイプラインの効率化されたワークフローを示しており、生の非構造化音声データをポーランドされた実用的なデータセットに変換する能力を紹介しています。
私たちのパイプラインは、いくつかの利点を提供します:
- 効果的:検証済みのスピーカーラベルと転写、正確な単語タイムスタンプ、および Whisper などのツールや他のオープンソースソリューションと比較して、過信されていない信頼度スコアを生成します。
- 堅牢性:スピーカーの重複とASRエラーを含むトランスクリプトのシナリオを含む、即興的な会話音声を処理します。
- 拡張可能:オプションのメタデータを活用でき、ラベルの信頼性を高めるための追加モダリティの統合にアップグレードできます。パイプラインは、様々な Olewave またはクライアント自身のラベル付けモデル(感情、セマンティクスなど)のプラグアンドプレイ統合もサポートしています。
- 効率性:高速に実行され、GPUリソースをほとんど必要としないため、コスト効率的です。
- 正確なタイミング情報で単語を正確にハイライトすることで、注釈者が音声全体を繰り返し聞くことなく、むーむーした不明瞭なセグメントをすばやく見つけてレビューできます。
- 注釈者が中程度の信頼度スコアを持つ単語に焦点を合わせるようにガイドすることで、すべての単語をレビューする必要性を最小化し、修正プロセスを合理化します。
これらのターゲット化されたインサイトを提供することで、パイプラインは効率を向上させ、手動作業を削減し、より費用効果的な注釈ワークフローを保証します。
以下は、パイプラインの出力の視覚化された例であり、スピーカーラベル、単語レベルのタイムスタンプと信頼度スコアを示しています:
図1。会話は、合成またはプロンプトされた音声ではなく、実際の相互作用から得られています。トランスクリプトは、ASRによって生成されたものではなく、人間によって手動でアップロードされました。スピーカーラベルも、スピーカーダイアリゼーションアルゴリズムから派生したものではなく、人間によって手動で追加されました。付属のJSONファイルには、スピーカーの時間間隔、会話トランスクリプト、単語レベルのタイムスタンプ、および信頼度スコアを含む詳細な転写が含まれています。電話レベルのタイムスタンプと信頼度スコアはリクエストに応じて利用可能です。
図2。ノイズの多い自発的な音声の後処理の例であり、各単語の下の値はその発音スコアを表しており、これは音声評価と密接に関連しています。ここは、いくつかの単語のスコアの説明です: a) 単語「一緒に」:「togeth-」のように発音され、末尾の「-er」は提示されず、「-o-」母音は非常に短い継続時間です。 b) 開始単語「it」:スペクトログラムに摩擦音があるにもかかわらず、聞くことはほとんどできません。低スコア0.47は、単語が欠落する可能性が高いことを意味します。 c) 最後に挿入された単語「lt」:その人はそれを言いませんでした。これは、トランスクリプトが誤ってHTMLで使用されるシンボル「<」(「<」)を含むためです。非常に低いスコア0.13は、私たちのデータクリーニングパイプラインによって削除できる挿入された単語であることを示します。
大規模な エンドツーエンド(E2E)フレームワークおよび 大規模なE2E ASRモデルは、 正確な単語レベルのタイムスタンプおよび 信頼性の高い単語レベルの信頼度スコアの制作に関して固有の制限がある広く認識されています。
これらの制限に対処するため、私たちは 非エンドツーエンド音声テキスト整列技術における深い専門知識を活用し、 メタデータ情報を組み込む高度な手順を開発しました。このアプローチにより、トランスクリプトから非話言葉(例:フィラー単語、背景ノイズの転写)を効果的にクリーニングし、最終出力の精度と信頼性をより高くすることができます。
以下は、データパイプラインの単語レベルのJSON出力のスニペットです。「speaker」フィールドは、この記録内のスピーカーのIDを示します。「start_time」と「end_time」フィールドは秒単位で、スピーキングスピーカーの時間スパンを示します。「block」フィールドには、同じスピーカーからの1つまたは複数の連続した発話が含まれています。各発話には、独自の開始時間、終了時間、トランスクリプト、スピーカーオーバーラップインジケーター、および信頼度スコアがあります。「overlap」フィールドがtrueの場合、現在のセグメントは隣接するセグメントとスピーカーオーバーラップを持っています。信頼度スコアは0から1の範囲です。
{
"speaker": 0,
"start_time": "47.18",
"end_time": "49.83",
"block": [
{
"start_time": "47.18",
"end_time": "49.83",
"transcript": "music-related jobs compared to New York and LA.",
"overlap": false,
"word_details": [
{
"start_time": "47.18",
"end_time": "47.53",
"word": "music",
"confidence": "0.97"
},
{
"start_time": "47.53",
"end_time": "47.89",
"word": "related",
"confidence": "0.79"
},
{
"start_time": "47.89",
"end_time": "48.44",
"word": "jobs",
"confidence": "0.98"
},
{
"start_time": "48.44",
"end_time": "48.90",
"word": "compared",
"confidence": "0.96"
},
{
"start_time": "48.90",
"end_time": "48.96",
"word": "to",
"confidence": "0.17"
},
{
"start_time": "48.96",
"end_time": "49.08",
"word": "new",
"confidence": "0.97"
},
{
"start_time": "49.08",
"end_time": "49.37",
"word": "york",
"confidence": "0.98"
},
{
"start_time": "49.37",
"end_time": "49.49",
"word": "and",
"confidence": "0.92"
},
{
"start_time": "49.49",
"end_time": "49.83",
"word": "la",
"confidence": "0.56"
}
]
}
]
},
