神經語言模型的擴展定律
在 GPT-3 使擴展感覺不可避免之前,這篇 OpenAI 論文使其可預測。
在 GPT-3 使擴展感覺不可避免之前,這篇 OpenAI 論文使其可預測。Kaplan 及其共著者在模型大小、數據集大小和計算預算方面進行了數百次訓練運行,發現語言模型損失在七個數量級上遵循乾淨的冪律。這些含義重新配置了該領域:給定固定的計算預算,有一個最優的模型大小和標記計數,而這在大多數情況下不是從業者一直在假設的。
本次講解涵蓋了三個主要數量、為什麼架構細節的重要性不如您的想像,以及該論文的計算最優邊界如何最終指導了從 GPT-3 到 Chinchilla 再到現代語音基礎模型的一切。還有一個關於演講者在批大小動態上發現的錯誤的注釋——如果您關心實驗設置,值得聽一下。如果您曾經必須為訓練預算辯護或向利益相關者解釋為什麼在這裡更大確實更好,這是基礎讀物,可以為您節省大量不著邊際的言論。排隊觀看吧。
