BigSSL:探索大规模半监督学习在自动语音识别中的前沿
当你采用在100M参数下击败最先进水平的半监督ASR方案,然后继续扩展会发生什么?
当你采用在100M参数下击败最先进水平的半监督ASR方案,然后继续扩展会发生什么?Google的BigSSL通过一个80亿参数的Conformer来回答这个问题,该模型在一百万小时的未标注YouTube音频和数万小时的监督数据上进行训练——并显示收益持续增长,特别是在尾部:低资源领域、口音语音和长型识别。
该论文实际上包含两项贡献。它是一项实证研究,探讨当你将SSL推进超过10亿参数时什么会崩溃、什么会扩展,同时也是一个演示,表明单个预训练编码器可以作为十几个下游ASR任务的通用起点,降低YouTube、电话和语音搜索基准上的WER下限。讲座涵盖了预训练管道、跨域的转移结果,以及对于任何正在考虑基础模型方法是否适合其语音栈的人的实际含义。如果你正在规划下一次大规模训练运行,值得加入队列。
