Tutorials
[長篇評論] Fully Sharded Data Parallel:用更少 GPU 進行更快的 AI 訓練
在有限的 GPU 預算上訓練十億參數的語音或語言模型曾經意味著要在管道並行、張量並行或 ZeRO 風格的優化器分片之間做出選擇。
Tutorials
[短篇評論] Fully Sharded Data Parallel:用更少 GPU 進行更快的 AI 訓練
Fully Sharded Data Parallel 是 Meta 對每個語音和語言團隊最終都會提出的問題的答案:我們如何在不提供數量級更多 GPU 的情況下訓練數量級更大的模型?
Tutorials
[長篇評論] 資料去重複使語言模型更優秀
資料去重複聽起來很無聊,直到你發現 C4 中單句 61 字的句子出現超過 60,000 次,以及在這樣語料庫訓練的語言模型會以令人不安的方式向使用者吐出訓練集文本的一部分
