[긴 리뷰] 'GShard': 조건부 연산 및 자동 샤딩으로 거대 모델 확장
Transformer를 100억 개 이상의 매개변수로 확장하는 것은 빠르게 철학적이 됩니다: 모든 토큰에 대해 전체 네트워크를 활성화하거나 각 토큰을 실제로 봐야 하는 전문가에게 라우팅합니까?
Transformer를 100억 개 이상의 매개변수로 확장하는 것은 빠르게 철학적이 됩니다: 모든 토큰에 대해 전체 네트워크를 활성화하거나 각 토큰을 실제로 봐야 하는 전문가에게 라우팅합니까? GShard는 Google의 획기적인 답변으로, 희소 Mixture-of-Experts 계층을 자동 샤딩 주석 시스템과 함께 쌍으로 만들어 single-program, multiple-data XLA 컴파일러가 600억 매개변수 다국어 번역 모델을 수천 개의 TPU 코어에 배치할 수 있도록 합니다.
이 긴 리뷰는 top-2 게이팅, 보조 부하 균형 손실, 그리고 GShard를 작동하게 하는 주석 기반 병렬화를 살펴봅니다. 또한 MoE 아키텍처를 업계 로드맵에 올린 번역 품질 향상도 다룹니다. MoE 음성 기초 모델이나 선형 계산 증가 없이 확장되는 다국어 ASR을 고려하는 음성 AI 팀의 경우, GShard는 나중에 Switch Transformer, GLaM, 그리고 현대 음성 MoE 작업에서 차용한 어휘를 설정한 논문입니다. 희소 확장이 향후 아키텍처의 어디든 있다면, 1시간을 투자할 가치가 있습니다.
