多语言 ASR 的联合无监督和有监督训练
预训练后微调已成为多语言 ASR 的默认方案,但这留下了很多不足:两个阶段不共享损失,有监督阶段可能悄悄地冲掉有用的自监督结构
预训练后微调已成为多语言 ASR 的默认方案,但这留下了很多不足:两个阶段不共享损失,有监督阶段可能悄悄地冲掉有用的自监督结构。Google 的 JUST 框架将它们融合为一个单一的联合目标——对比损失、掩蔽预测损失和 RNN-T 有监督损失都同时通过一个共享编码器反向传播。
在 42 语言的 Multilingual Librispeech 基准上,JUST 超越了级联预训练管道和纯有监督基线,在标注数据是瓶颈的低资源语言上获得了特别强的收益。这次讲座解释了三个损失如何平衡、为什么联合训练在不同文字和音韵系统中推广得更好,以及该方法在哪里仍然为语言特定的适配器留有空间。如果你在整理多语言 ASR 堆栈并在分阶段训练运行中消耗周期,这个一体化方案值得认真研究。
