One-Edit-Distance FSA/Network-based (OEDN) in Mispronunciation Detection and Accented ASR

Tutorials

在誤讀檢測和帶口音ASR中的單編輯距離FSA/基於網絡(OEDN)

非母語聲學建模存在先有雞還是先有蛋的問題:不良的音素對齊產生不良的模型,而不良的模型產生不良的對齊。

非母語聲學建模存在先有雞還是先有蛋的問題:不良的音素對齊產生不良的模型,而不良的模型產生不良的對齊。本演講介紹的單編輯距離FSA/基於網絡(OEDN)方法通過使用受約束的音素解碼器來識別在規範發音的單編輯距離內最有可能發音的序列,然後迭代檢測和識別直到不再出現誤讀音,從而打破了這個循環。

在300小時的非母語自發語料庫上,與良好調整的上下文相關分解TDNN HMM基線(神經拓撲匹配)相比,所得的聲學模型將WER降低了6%,這在該規模上不是一個小的差值。除了準確性的勝利,管道還生成了非母語英語學習者的常見誤讀模式的數據驅動目錄,這對語音評估和發音評分產品直接有用。演講介紹了發音質量評分如何驅動初始檢測,單編輯距離約束如何保持搜索的可解性,以及重複迭代如何持續改進對齊直到收斂。如果您正在從事帶口音ASR、計算機輔助發音訓練或詞典不靠譜的聲學建模任務,點擊播放以獲得具體的、可重現的方案。