OLIGN — 詞和音素對齐服務

比 Montreal FA 和 WhisperX 更準確的詞級時間戳。

一項強制對齐服務,輸出詞級和音素級時間資訊,並提供每音素信度指標。已進入 fa-bench(我們開放的強制對齐基準),作為十個系統中的一個。

REST · 測試版 https://api.olewave.com/olign/v1

公開的 REST API 正處於封閉測試版。聯絡我們以申請測試令牌和存取權限。

清晰語音的詞級準確性

詞邊界錯誤 (WBE),以毫秒為單位 — 越低越好。邊界 F1 @ ±20 ms — 越高越好。在 fa-bench 的 fabench 協議下測量,在保留的、說話者不相交的分割上。

分割 WBE (ms) ↓ 詞 F1 @ 20 ms ↑
  olignMFA 3.4 olignMFA 3.4
timit / dev16.019.20.8070.729

平均詞邊界位置改進 3.2 毫秒,在嚴格的 ±20 毫秒閾值下領先 8 點 F1。詞級結果在 timit/testbuckeye/devbuckeye/test 上遵循相同模式,已發佈在 olign/docs/results.md

在噪音下的表現

來自 Kaldi voxceleb/v2 配方的四種情況 — 混響、MUSAN 加法雜訊、音樂、人聲喧囂 — 相同的基準、相同的分割,只有聲學特性不同。神經框架分類器在噪音下崩潰;olign 和 MFA 優雅地降級。值是 Buckeye 上的詞級平均絕對誤差趨勢;完整表格在 olign/docs/results.md

系統清晰混響雜訊音樂人聲喧囂
olign
MFA 3.4
WhisperX / Charsiu
MAPS

olign 在清晰混響音樂人聲喧囂上勝出;MFA 在加法雜訊上略優。神經框架分類器 (MAPS, Charsiu) 崩潰 — MAPS 在音素級等價物上大約降低 7 倍,這是噪音軸產生的最清楚的結果。在清晰 + 有雜訊的音頻上訓練邊界精化器可以實現這一點:它贏得了每一個有雜訊的單元格,並在清晰語音上花費 +0.1 毫秒,在運行間變異內。

我們一起發佈的注意事項

我們知道的每一個方法論折衷。我們在數字旁發佈這些,而不是在它們下面。

  1. 訓練重疊

    olign 包含在 TIMIT 和 Buckeye 的 train 分割上訓練的分量。評估的分割與其在說話者上不相交 — 零重疊,根據分割列表驗證 — 所以這些是真正保留的數字。但 MFA、Charsiu、BFA 和 WhisperX 完全沒有在任何語料庫上進行過訓練,而且在沒有明確說明的情況下,這些列的比較不具有直接可比性。

  2. 專有配置

    配置未公開;該行報告 olign 的最佳配置,就像任何條目一樣。

  3. 不是論文基準

    olign 只在 fabench 協議下評分,而不是 MFA-2026 的複製。

  4. 分數因運行而異

    相同的輸入在 overall 評估中可能不同;邊界時間是穩定的,這是基準測量的內容。

  5. 更好的邊界,稍微更差的標籤

    olign 相對於 MFA 的音素錯誤率略高 (timit/dev 上 33.1% vs 32.7%),但邊界位置更好。其標籤與基準標準的一致性較低;其邊界位置更接近。這兩個事實都應該出現在我們提出的任何主張中。

申請 olign 的測試版存取。

REST API 正處於封閉測試版。獲取測試令牌,對您的工作負載運行 olign — 批量清理、實時字幕、發音評估、數據集標記 — 並在您自己的數據上查看數字。

聯絡 Olewave 以取得測試版令牌 →