Tutorials
[長篇評論] Fully Sharded Data Parallel:用更少 GPU 進行更快的 AI 訓練
在有限的 GPU 預算上訓練十億參數的語音或語言模型曾經意味著要在管道並行、張量並行或 ZeRO 風格的優化器分片之間做出選擇。
Tutorials
[短篇評論] Fully Sharded Data Parallel:用更少 GPU 進行更快的 AI 訓練
Fully Sharded Data Parallel 是 Meta 對每個語音和語言團隊最終都會提出的問題的答案:我們如何在不提供數量級更多 GPU 的情況下訓練數量級更大的模型?
