比 Montreal FA 和 WhisperX 更准确的单词时间戳。
一项强制对齐服务,可以生成单词级和音素级的时间戳,并配有每个音素的置信度代理。在 fa-bench 中参与竞争,这是我们的开源强制对齐基准,十个系统之一。
https://api.olewave.com/olign/v1
公共 REST API 处于封闭测试阶段。联系我们以请求测试令牌和访问权限。
清晰语音的单词级准确性
单词边界误差 (WBE),单位为毫秒 — 越低越好。边界 F1 @ ±20 ms — 越高越好。在 fa-bench 的 fabench 协议下,基于保留的、说话者不相交的拆分进行测量。
| 拆分 | WBE (ms) ↓ | Word F1 @ 20 ms ↑ | ||
|---|---|---|---|---|
| olign | MFA 3.4 | olign | MFA 3.4 | |
| timit / dev | 16.0 | 19.2 | 0.807 | 0.729 |
平均单词边界位置改进了 3.2 毫秒,在严格的 ±20 毫秒阈值处领先 8 点 F1。单词级结果在 timit/test、buckeye/dev 和 buckeye/test 上遵循相同模式,已发布在 olign/docs/results.md。
它在噪声下的表现
来自 Kaldi voxceleb/v2 配方的四个条件 — 混响、MUSAN 加性噪声、音乐、babble — 相同的黄金标准、相同的拆分、仅声学特性不同。神经帧分类器在噪声下崩溃;olign 和 MFA 优雅降级。值是 Buckeye 上的单词级 MAE 趋势;完整表格在 olign/docs/results.md。
| 系统 | 清洁 | 混响 | 噪声 | 音乐 | babble |
|---|---|---|---|---|---|
| olign | ✓ | ✓ | — | ✓ | ✓ |
| MFA 3.4 | — | — | ✓ | — | — |
| WhisperX / Charsiu | — | — | — | — | — |
| MAPS | — | — | — | — | — |
olign 在清洁、混响、音乐和 babble 上获胜;MFA 在加性噪声上略微领先。神经帧分类器 (MAPS, Charsiu) 崩溃 — MAPS 在音素级等效物上大约下降 7 倍,这是噪声维度产生的最明显结果。在清洁 + 噪声音频上训练边界细化器是获得这一优势的原因:它在每个噪声项上都获胜,对清洁语音的成本为 +0.1 毫秒,在运行间的正常波动范围内。
我们一并发布的注意事项
我们意识到的每个方法上的权衡。我们将这些与数字一起发布,而不是单独列出。
-
训练重叠
olign 包含一个在 TIMIT 和 Buckeye 的train拆分上训练的组件。评估拆分与其说话者不相交 — 零重叠,针对拆分列表进行了验证 — 所以这些是真正的保留数字。但 MFA、Charsiu、BFA 和 WhisperX 对任何语料库都完全没有接触,不说明的话这些列不是可直接比较的。
-
专有配置
配置未公开;该行展示了 olign 的最佳配置,与其他条目一样。
-
不是论文基线
olign 仅在
fabench协议下评分,不是基于 MFA-2026 复制。 -
分数在运行间变化
相同的输入在评估
overall中可能会有所不同;边界时间是稳定的,这是基准所衡量的。 -
更好的边界,稍差的标签
olign 的音素错误率略高于 MFA (timit/dev 上 33.1% vs 32.7%),但边界位置更好。其标签与黄金标准的一致性较低;其边界更接近。这两个事实都属于我们所做的任何声明。
请求 olign 的测试版访问权限。
REST API 处于封闭测试阶段。获取测试令牌,针对您的工作负载运行 olign — 批处理清理、实时字幕、发音评估、数据集标记 — 并查看您自己数据上的结果。
联系 Olewave 获取测试版令牌 →