Non Collision Mispronunciation Addition (NCMA) for Accented ASR

Tutorials

非冲突误发音添加(NCMA)用于口音ASR

带口音和非母语的语音会以隐蔽的方式破坏发音字典,从而污染你的声学模型对齐,这项Interspeech 2021的工作提出了一个看似简单的问题:如果我们只是将检测到的

带口音和非母语的语音会以隐蔽的方式破坏发音字典,从而污染你的声学模型对齐,这项Interspeech 2021的工作提出了一个看似简单的问题:如果我们只是将检测到的误发音添加到字典并重新训练呢?非冲突误发音添加(NCMA)是PAII提交到Interspeech 2021非母语儿童英文接近赛道ASR挑战赛的技术,它直指儿童语音、L2学习者和口音成人语音对生产ASR造成的WER难题。

演示文稿介绍了NCMA如何在向词典注入新发音时避免冲突,更好的音素对齐如何反馈到更强的声学模型,以及整个检测-添加-重新对齐循环如何转化为在真正困难基准上的可测量WER下降。该技术基于W. Chu、P. Chang和J. Xiao在Interspeech 2021发表的论文,演示文稿将算法选择与激励它们的挑战提交联系起来。如果你正在为教育、儿童产品、计算机辅助语言学习或任何口音说话者的长尾市场构建ASR,其中通用字典无声地失效,值得花时间了解有针对性的词典修复如何胜过蛮力数据收集。