Google Researcher's In-Depth Analysis on End-to-End Speech Recognition, Part 1: Overview & Modeling

Tutorials

Google研究员对端到端语音识别的深入分析,第1部分:概述和建模

深度学习的十年使ASR词错误率相对下降了50%以上,同时也让经典HMM管道看起来像是过时产物。

深度学习的十年使ASR词错误率相对下降了50%以上,同时也让经典HMM管道看起来像是过时产物。Prabhavalkar、Hori、Sainath、Schluter和Watanabe发表的端到端ASR调查的这个第1部分分析了E2E ASR模型的分类法,并将其与大多数从事该领域的工程师成长过程中接触的HMM遗产进行了比较。这是一个框架性的情节,使该调查的其余部分清晰起来。

该概述关注建模——CTC、基于注意力的编码器-解码器和转导器变体在归纳偏差上如何不同,它们在减少对ASR特定领域专业知识依赖方面为您提供什么,以及为什么行业集中在能从数据中学习更多一致的全神经堆栈上。它为该领域后续部分打下了基础,涵盖训练、解码、外部语言模型集成、部署、性能分析和该领域的未来方向。如果您正在入职一个现代ASR团队或试图在Kaldi风格的混合系统和Whisper、NeMo、ESPnet或基于转导器的识别器之类的东西之间做出选择,这是您在行走该地形之前想要的地图。