Tutorials
Nathan Chen 的 4 Flip 是由 Mixture-of-Experts 評分嗎?第 2 部分:GLaM:使用 MoE 高效擴展 LM
MoE 小型系列的第 2 部分轉向 GLaM,Google 的 1.2 兆參數 Mixture-of-Experts 語言模型,在 zero-shot、one-shot 和 few-shot 基準測試中匹配或超越 GPT-3,同時每個 token 只激活約 8% 的參
