[Long Review] 'GShard': Scaling Giant Models with Conditional Computation and Automatic Sharding

Tutorials

[ロングレビュー] 「GShard」:条件付き計算と自動シャーディングを使用した巨大モデルのスケーリング

Transformerを1000億パラメータを超えてスケーリングすることは急速に哲学的になります:すべてのトークンに対してネットワーク全体をアクティブにしますか、それとも各トークンを実際に見る必要があるスペシャリストにルーティングしますか?

Transformerを1000億パラメータを超えてスケーリングすることは急速に哲学的になります:すべてのトークンに対してネットワーク全体をアクティブにしますか、それとも各トークンを実際に見る必要があるスペシャリストにルーティングしますか?GShardはGoogleの画期的な答えであり、スパースMixture-of-Expertsレイヤーを自動シャーディングアノテーションシステムと組み合わせ、単一プログラム複数データXLAコンパイラが6000億パラメータの多言語翻訳モデルを数千のTPUコア全体に配置できるようにします。

このロングレビューは、top-2ゲーティング、補助的な負荷分散損失、およびGShardを動作させる注釈駆動型並列化、ならびにMoEアーキテクチャを業界ロードマップに載せた翻訳品質の改善を詳細に説明します。音声AIチームがMoEスピーチ基盤モデルまたは線形計算の爆発的増加なしでスケーリングする多言語ASRに目を向けている場合、GShardはSwitch Transformer、GLaM、および最新のスピーチMoE作業によって後に採用された用語を確立した論文です。スパーススケーリングがアーキテクチャの将来のどこかにある場合は、1時間を確保してください。