Scaling Laws for Neural Language Models

Tutorials

神经语言模型的扩展定律

在 GPT-3 使扩展变得不可避免之前,这篇 OpenAI 论文已使其可预测。

在 GPT-3 使扩展变得不可避免之前,这篇 OpenAI 论文已使其可预测。Kaplan 及其合著者在模型大小、数据集大小和计算预算中运行了数百次训练,发现语言模型损失在七个数量级上遵循清晰的幂律。这些含义重新塑造了该领域:给定固定的计算预算,存在最优的模型大小和令牌计数,通常不是实践者一直假设的那样。

演讲涵盖了三个关键量、为什么架构细节没有您想象的那么重要,以及该论文的计算最优边界如何最终指导从 GPT-3 到 Chinchilla 到现代语音基础模型的一切。还有一个关于演示者在批大小动态上发现的错误的注记——如果您关心实验设置,值得听听。如果您曾经需要证明训练预算的合理性或向利益相关者解释为什么在这里更大真的更好,这是节省您大量冗长论证的基础读物。排队进行。