单编辑距离FSA/基于网络(OEDN)的误发音检测和口音ASR
非母语声学建模面临循环依赖问题:不好的音素对齐产生不好的模型,不好的模型产生不好的对齐。
非母语声学建模面临循环依赖问题:不好的音素对齐产生不好的模型,不好的模型产生不好的对齐。这项关于单编辑距离FSA/基于网络(OEDN)方法的讲座通过使用受约束的音素解码器来识别在规范发音的一个编辑距离内最可能的发音序列,然后迭代检测和识别直到没有更多误发音出现,从而打破这个循环。
在300小时的非母语自发语料库上,所得的声学模型与调谐良好的上下文相关因式分解TDNN HMM基线相比,WER降低了6%,具有匹配的神经拓扑,这在该规模上并非小幅改进。除了精度的提升,管道输出了来自非母语英语学习者的常见误发音模式的数据驱动目录,这对语音评估和发音评分产品直接有用。讲座介绍了发音质量分数如何驱动初始检测,单编辑距离约束如何保持搜索的可行性,以及重复迭代如何持续改进对齐直到收敛。如果你正在从事口音ASR、计算机辅助发音训练或任何字典对你撒谎的声学建模任务,点击播放获得一个具体、可重复的方法。
