比 Montreal FA 和 WhisperX 更準確的詞級時間戳。
一項強制對齐服務,輸出詞級和音素級時間資訊,並提供每音素信度指標。已進入 fa-bench(我們開放的強制對齐基準),作為十個系統中的一個。
https://api.olewave.com/olign/v1
公開的 REST API 正處於封閉測試版。聯絡我們以申請測試令牌和存取權限。
清晰語音的詞級準確性
詞邊界錯誤 (WBE),以毫秒為單位 — 越低越好。邊界 F1 @ ±20 ms — 越高越好。在 fa-bench 的 fabench 協議下測量,在保留的、說話者不相交的分割上。
| 分割 | WBE (ms) ↓ | 詞 F1 @ 20 ms ↑ | ||
|---|---|---|---|---|
| olign | MFA 3.4 | olign | MFA 3.4 | |
| timit / dev | 16.0 | 19.2 | 0.807 | 0.729 |
平均詞邊界位置改進 3.2 毫秒,在嚴格的 ±20 毫秒閾值下領先 8 點 F1。詞級結果在 timit/test、buckeye/dev 和 buckeye/test 上遵循相同模式,已發佈在 olign/docs/results.md。
在噪音下的表現
來自 Kaldi voxceleb/v2 配方的四種情況 — 混響、MUSAN 加法雜訊、音樂、人聲喧囂 — 相同的基準、相同的分割,只有聲學特性不同。神經框架分類器在噪音下崩潰;olign 和 MFA 優雅地降級。值是 Buckeye 上的詞級平均絕對誤差趨勢;完整表格在 olign/docs/results.md。
| 系統 | 清晰 | 混響 | 雜訊 | 音樂 | 人聲喧囂 |
|---|---|---|---|---|---|
| olign | ✓ | ✓ | — | ✓ | ✓ |
| MFA 3.4 | — | — | ✓ | — | — |
| WhisperX / Charsiu | — | — | — | — | — |
| MAPS | — | — | — | — | — |
olign 在清晰、混響、音樂和人聲喧囂上勝出;MFA 在加法雜訊上略優。神經框架分類器 (MAPS, Charsiu) 崩潰 — MAPS 在音素級等價物上大約降低 7 倍,這是噪音軸產生的最清楚的結果。在清晰 + 有雜訊的音頻上訓練邊界精化器可以實現這一點:它贏得了每一個有雜訊的單元格,並在清晰語音上花費 +0.1 毫秒,在運行間變異內。
我們一起發佈的注意事項
我們知道的每一個方法論折衷。我們在數字旁發佈這些,而不是在它們下面。
-
訓練重疊
olign 包含在 TIMIT 和 Buckeye 的 train 分割上訓練的分量。評估的分割與其在說話者上不相交 — 零重疊,根據分割列表驗證 — 所以這些是真正保留的數字。但 MFA、Charsiu、BFA 和 WhisperX 完全沒有在任何語料庫上進行過訓練,而且在沒有明確說明的情況下,這些列的比較不具有直接可比性。
-
專有配置
配置未公開;該行報告 olign 的最佳配置,就像任何條目一樣。
-
不是論文基準
olign 只在
fabench協議下評分,而不是 MFA-2026 的複製。 -
分數因運行而異
相同的輸入在
overall評估中可能不同;邊界時間是穩定的,這是基準測量的內容。 -
更好的邊界,稍微更差的標籤
olign 相對於 MFA 的音素錯誤率略高 (timit/dev 上 33.1% vs 32.7%),但邊界位置更好。其標籤與基準標準的一致性較低;其邊界位置更接近。這兩個事實都應該出現在我們提出的任何主張中。
申請 olign 的測試版存取。
REST API 正處於封閉測試版。獲取測試令牌,對您的工作負載運行 olign — 批量清理、實時字幕、發音評估、數據集標記 — 並在您自己的數據上查看數字。
聯絡 Olewave 以取得測試版令牌 →