XLS-R: 大规模自监督跨语言语音表示学习
跨语言语音预训练的可扩展性能能推进到什么程度?
跨语言语音预训练的可扩展性能能推进到什么程度?Meta 的 XLS-R 用 20 亿参数回答了这个问题,在 128 种语言的 436,000 小时未标记音频上进行训练——相比 XLSR-53 有数量级的提升,在发布时是最大的公开多语言语音模型。
结果支持了这个规模故事。XLS-R 在 BABEL、CommonVoice 和 VoxPopuli 语音识别上设立了新的最优性能,以及——也许更令人惊讶的是——在英文语音翻译上,它击败了建立在更大文本侧模型上的先前系统。演讲涵盖了这 128 种语言的数据管理、wav2vec 2.0 架构在 20 亿参数时的表现,以及当您尝试在低资源数据上微调这么大的模型时会发生什么。如果您在 HuggingFace 还未覆盖的语言中从事任何语音任务,XLS-R 可能是您应该首先尝试的检查点——深入研究解释了原因。
