[长评] 'GShard':使用条件计算和自动分片扩展巨大模型
将 Transformer 扩展到数千亿参数以上会很快变成哲学问题:你是激活整个网络来处理每个 token,还是将每个 token 路由给真正需要看到它的专家?
将 Transformer 扩展到数千亿参数以上会很快变成哲学问题:你是激活整个网络来处理每个 token,还是将每个 token 路由给真正需要看到它的专家?GShard 是 Google 的标志性答案,将稀疏 Mixture-of-Experts 层与自动分片注解系统配对,让单个程序多数据 XLA 编译器能够将 600 亿参数的多语言翻译模型放置在数千个 TPU 核心上。
这篇长评论详细讲述了 top-2 gating、辅助负载均衡损失以及驱动 GShard 运行的注解驱动并行性,以及将 MoE 架构放在业界路线图上的翻译质量收益。对于考虑 MoE 语音基础模型或在不产生线性计算爆炸的情况下扩展的多语言 ASR 的语音 AI 团队来说,GShard 是设定了后来被 Switch Transformer、GLaM 和现代语音 MoE 工作借用的词汇的论文。如果稀疏扩展与您的架构未来有任何关系,请留出一小时。
