是什麼讓Olewave的語音資料清理管道有效且獨特
Olewave的Olign管道如何將原始音訊轉變為可投入生產的ASR/TTS訓練資料——經過驗證的轉錄、詞級時間戳和置信度分數,無需人工標記。
Olewave最先進且高度可客製化的語音資料清理管道與其語音資料蒐集管道無縫整合,一起形成Olewave的語音資料策劃管道。此端到端系統經過精心設計,可大規模提供高品質、一致且具成本效益的語音資料集,可針對各種下游應用進行客製化。此外,我們提供大規模、具成本效益的語音資料集透過我們的管道精選,有多種語言版本且涵蓋多樣主題。
Olewave最先進且高度可客製化的語音資料清理管道與其語音資料蒐集管道無縫整合,一起形成Olewave的語音資料策劃管道。
下圖說明我們語音資料清理管道的簡化工作流程,展示其將原始、非結構化語音資料轉變為經過打磨、可行性資料集的能力。
我們的管道提供幾個優勢:
- 有效:與Whisper和其他開源解決方案相比,它產生經過驗證的說話者標籤和轉錄、準確的詞時間戳和非過度自信的置信度分數。
- 穩健性:它處理即興對話語音,包括有說話者重疊和轉錄包含ASR錯誤的情況。
- 可擴展:它利用可選元資料,可升級以納入其他模態以提高標籤可靠性。該管道還支援Olewave的或客戶自己的標籤標記模型(例如情感、語義等)的即插即用整合。
- 效率:它運行快速且具成本效益,因為它需要很少或無GPU資源。
- 精確突出具有準確計時資訊的詞語,使標記者能夠快速定位和檢查含糊或不清楚的片段,而無需反覆聆聽整個音訊。
- 引導標記者關注中等範圍置信度分數的詞語,最小化檢查每個詞的需要並簡化修正流程。
透過提供這些有針對性的見解,我們的管道提高效率、減少人工工作,並確保更具成本效益的標記工作流程。
以下是管道輸出的可視化範例,展示說話者標籤、詞級時間戳和置信度分數:
圖1. 該對話來自真實世界的互動,而非合成或提示語音。轉錄是人工上傳的,而非由ASR生成。說話者標籤也是人工添加的,而非來自說話者二值化演算法。附帶的JSON檔案包括詳細的轉錄、說話者時間間隔、對話轉錄、詞級時間戳和置信度分數。電話級時間戳和置信度分數也可根據要求提供。
圖2. 嘈雜自發語音後處理的範例,其中每個詞下方的值代表其發音分數,這與語音評估密切相關。以下是某些詞分數的解釋:a)單詞'together':發音方式為'togeth-',尾部'-er'未呈現,'-o-'元音持續時間非常短,幾乎消失。b)開始詞'it':儘管頻譜圖上有摩擦音,我幾乎聽不到。它的分數為0.47,這意味著該詞可能會丟失。c)末尾插入的詞'lt':該人沒有說。這是因為轉錄錯誤地包括'<'(HTML中使用的'<'符號)。非常低的分數0.13表示這是一個插入的詞,可以被我們的資料清理管道移除。
在學術界和產業界廣泛認可,大型端到端(E2E)框架和大型E2E ASR模型在產生準確的詞級時間戳和可靠的詞級置信度分數方面分別存在固有限制。
為了解決這些限制,我們利用我們在非端到端語音轉文字對齊技術方面的深厚專業知識,並開發了納入元資料資訊的複雜程序。此方法允許我們有效地從轉錄中清理非語言內容(例如填充詞、背景雜音轉錄),確保最終輸出的準確性和可靠性。
以下是資料管道的詞級JSON輸出片段。'speaker'欄位表示此錄音中說話者的ID。'start_time'和'end_time'欄位以秒為單位,表示說話者的說話時間跨度。'block'欄位包含來自同一說話者的一個或多個連續陳述。每個陳述都有其自己的開始時間、結束時間、轉錄、說話者重疊指示符和置信度分數。當'overlap'欄位為真時,表示目前片段與相鄰片段有說話者重疊。置信度分數範圍從0到1。
{
"speaker": 0,
"start_time": "47.18",
"end_time": "49.83",
"block": [
{
"start_time": "47.18",
"end_time": "49.83",
"transcript": "music-related jobs compared to New York and LA.",
"overlap": false,
"word_details": [
{
"start_time": "47.18",
"end_time": "47.53",
"word": "music",
"confidence": "0.97"
},
{
"start_time": "47.53",
"end_time": "47.89",
"word": "related",
"confidence": "0.79"
},
{
"start_time": "47.89",
"end_time": "48.44",
"word": "jobs",
"confidence": "0.98"
},
{
"start_time": "48.44",
"end_time": "48.90",
"word": "compared",
"confidence": "0.96"
},
{
"start_time": "48.90",
"end_time": "48.96",
"word": "to",
"confidence": "0.17"
},
{
"start_time": "48.96",
"end_time": "49.08",
"word": "new",
"confidence": "0.97"
},
{
"start_time": "49.08",
"end_time": "49.37",
"word": "york",
"confidence": "0.98"
},
{
"start_time": "49.37",
"end_time": "49.49",
"word": "and",
"confidence": "0.92"
},
{
"start_time": "49.49",
"end_time": "49.83",
"word": "la",
"confidence": "0.56"
}
]
}
]
},
