Tutorials
Nathan Chen 的 4 周跳是由 Mixture-of-Experts 评判的吗?第 1 部分:Switch Transformers:稀疏 MoE 模型
带着对 Nathan Chen 四周跳评分的眨眼暗示,这次演讲详细讲述了 Switch Transformer,这是 Google 对 Mixture-of-Experts 扩展的简洁而激进的简化。
Tutorials
Nathan Chen的四周跳是由Mixture-of-Experts评分的吗?第2部分:GLaM:使用MoE的LMs高效扩展
MoE迷你系列的第2部分转向GLaM,Google的1.2万亿参数Mixture-of-Experts语言模型,在零样本、单样本和少样本基准上与GPT-3相当或超越,同时仅激活其约8%的参
Tutorials
Transformer:Attention is All You Need和Listen, Attend and Spell——从语音视角
两份论文,一个故事。"Attention Is All You Need"为世界带来了Transformer,改变了序列建模的方式,而"Listen, Attend and Spell"(LAS)一年前对端到端语音
