[Long Review] Fully Sharded Data Parallel: faster AI training with fewer GPUs

Tutorials

[长评] 完全分片数据并行:用更少的GPU进行更快的AI训练

用有限的GPU预算训练十亿参数的语音或语言模型,通常需要在管道并行、张量并行或ZeRO风格优化器分片之间权衡。

用有限的GPU预算训练十亿参数的语音或语言模型,通常需要在管道并行、张量并行或ZeRO风格优化器分片之间权衡。Facebook的完全分片数据并行(FSDP),现已在FairScale中发布,后来被集成到PyTorch,提供了一个更简洁的解决方案:在数据并行工作者之间将参数进行分片,在每个微批处理时及时收集它们,并使通信与计算重叠,使总耗时保持较低。

这篇长评介绍了为什么FSDP在概念上比层内并行或管道并行更简单,统一参数分片如何优于仅优化器加梯度的方法,以及可选的CPU卸载如何使你能够加载本不应该加载的模型。如果你正在训练TTS声学模型、wav2vec风格的基础模型或用于语音助手的LLM,FSDP正迅速成为在没有数据中心规模集群的情况下进行扩展的必要条件。如果你想在启用它之前了解其工作原理,请阅读这次深潜。