[๊ธด ๋ฆฌ๋ทฐ] 'GShard': ์กฐ๊ฑด๋ถ ์ฐ์ฐ ๋ฐ ์๋ ์ค๋ฉ์ผ๋ก ๊ฑฐ๋ ๋ชจ๋ธ ํ์ฅ
Transformer๋ฅผ 100์ต ๊ฐ ์ด์์ ๋งค๊ฐ๋ณ์๋ก ํ์ฅํ๋ ๊ฒ์ ๋น ๋ฅด๊ฒ ์ฒ ํ์ ์ด ๋ฉ๋๋ค: ๋ชจ๋ ํ ํฐ์ ๋ํด ์ ์ฒด ๋คํธ์ํฌ๋ฅผ ํ์ฑํํ๊ฑฐ๋ ๊ฐ ํ ํฐ์ ์ค์ ๋ก ๋ด์ผ ํ๋ ์ ๋ฌธ๊ฐ์๊ฒ ๋ผ์ฐํ ํฉ๋๊น?
์ธ์๋ฅ์ด์ฒ๋ผ ๋ฎ์ ๋ฌ์์ ํผ๊ฒจ ์ค์ผ์ดํฐ๋ค: Kullback-Leibler ๋ฐ์ฐ์ด ๊ทธ๋ค์ ์ฐจ์ด๋ฅผ ๊ตฌ๋ณํ ์ ์์ต๋๊น?
์คํผ์ปค ์ ์์ ์ํ์ค-ํฌ-์ํ์ค ๋ชจ๋ธ์ ์ธ์ฝ๋์ ์ด๋ ต๊ฒ ํ๋ํ ์ํฅ ํํ์ ์์์ํค์ง ์๊ณ ์ ์์ํค๋ ค๊ณ ์ค์ ๋ก ์๋ํ ๋๊น์ง ํด๊ฒฐ๋ ๊ฒ์ฒ๋ผ ๋ค๋ฆฌ๋ ASR ๋ฌธ์ ์ค ํ๋์ ๋๋ค.
Nathan Chen์ 4ํ์ ํ๋ฆฝ์ด Mixture-of-Experts๋ก ์ฑ์ ๋ฉ๋๊น? Part 1: Switch Transformers: ํฌ์ MoE ๋ชจ๋ธ
Nathan Chen์ 4ํ์ ์ ์์ ๋ํ ์ฐ์ค๊ฐฏ์๋ฆฌ๋ก ํํ๋๋ ์ด ํ ๋ก ์ Switch Transformer๋ฅผ ์ดํด๋ด ๋๋ค. Google์ Mixture-of-Experts ํ์ฅ์ ๋ํ ๊น๋ํ๊ณ ๊ณผ๊ฐํ๊ฒ ๋จ์ํ๋ ํด์์ ๋๋ค.
Nathan Chen์ 4 Flip์ด Mixture-of-Experts๋ก ์ฑ์ ๋๋์? Part 2: GLaM:Efficient Scaling of LMs with MoE
MoE ๋ฏธ๋ ์๋ฆฌ์ฆ์ Part 2๋ GLaM์ผ๋ก ์ด์ ์ ๋ง์ถฅ๋๋ค. Google์ 1.2์กฐ-ํ๋ผ๋ฏธํฐ Mixture-of-Experts ์ธ์ด ๋ชจ๋ธ๋ก, ์ ๋ก-์ท, ์-์ท, ๊ทธ๋ฆฌ๊ณ ํจ-์ท ๋ฒค์น๋งํฌ์์ GPT-3๊ณผ ๋๋ฑํ๊ฑฐ๋ ๋ฅ๊ฐํ๋ฉฐ ํ ํฐ๋น ์ฝ 8%์ ํ๋ผ๋ฏธํฐ๋ง ํ์ฑํํฉ๋๋ค
์์ฑ ๊ด์ ์์ ๊ฒํ ๋ BERT ๋ ผ๋ฌธ
BERT๋ NLP์์ ๊ฑฐ์ ์๊ฐ๊ฐ ํ์ ์์ง๋ง, ์์ฑ ์์ง๋์ด์ ๊ด์ ์์ ์ฝ์ผ๋ฉด ํ์ค "๋ง์คํฌ๋ ์ธ์ด ๋ชจ๋ธ๋ง์ด ๋ชจ๋ ๊ฒ์ ๋ฐ๊ฟจ๋ค"๋ ์์ฝ๊ณผ๋ ๋ค๋ฅธ ๊ตํ๋ค์ ๋ฐ๊ฒฌํฉ๋๋ค.
