ニューラル言語モデルのスケーリング法則
GPT-3がスケーリングを不可避なものにする前に、このOpenAIの論文はそれを予測可能にしました。
GPT-3がスケーリングを不可避なものにする前に、このOpenAIの論文はそれを予測可能にしました。Kaplanと共著者は、モデルサイズ、データセットサイズ、計算予算全体にわたって数百の訓練実行を行い、言語モデル損失が7桁にわたってシンプルな電力則に従うことを発見しました。この発見は分野全体の見方を変えました—固定計算予算が与えられた場合、最適なモデルサイズとトークン数があり、それはほとんどプラクティショナーが想定していたものではありません。
ウォークスルーでは、3つの主要な量、アーキテクチャの詳細があなたが考えるほど重要でない理由、そしてこの論文の計算最適フロンティアがGPT-3からChinchillaから現代的音声基盤モデルまでのすべてをガイドする方法について説明しています。プレゼンテーターがバッチサイズダイナミクスに関する間違いを指摘することについてのメモもあります—実験的セットアップについて気になる場合は聞く価値があります。訓練予算を正当化する必要があったことがある場合、または利害関係者に大きいほうが本当に優れているここでの理由を説明する必要がある場合、これはあなたに根拠のない説明を避けさせる基礎的な読書です。視聴キューに入れてください。
