[長評] 'GShard':使用條件計算和自動分片擴展巨型模型
將 Transformer 擴展到超過一千億個參數很快會變成哲學問題:你是為每個令牌激活整個網絡,還是將每個令牌路由到真正需要查看它的專家?
將 Transformer 擴展到超過一千億個參數很快會變成哲學問題:你是為每個令牌激活整個網絡,還是將每個令牌路由到真正需要查看它的專家?GShard 是 Google 的標誌性答案,它將稀疏 Mixture-of-Experts 層與自動分片註釋系統相結合,使單個程序多數據 XLA 編譯器能夠將一個 600 億參數的多語言翻譯模型放在數千個 TPU 核心上。
這個長評論詳細介紹了 top-2 門控、輔助負載均衡損失以及使 GShard 正常運行的註釋驅動並行性,加上將 MoE 架構放在業界路線圖上的翻譯質量改進。對於考慮使用 MoE 語音基礎模型或無線性計算增長的多語言 ASR 的語音 AI 團隊來說,GShard 是後來被 Switch Transformer、GLaM 和現代語音 MoE 工作借用的詞彙的開創性論文。如果稀疏擴展在你的架構未來中有任何一席之地,請留出一個小時。
