LoRA: allow a high school student to train Large Language Model (GPT-3) with a gaming graphics card

Tutorials

LoRA:讓高中生能用遊戲顯卡訓練大語言模型 (GPT-3)

對 175B 參數的 GPT-3 進行完整微調對幾乎所有人來說都不可行——僅存儲就排除了它,更不用說 GPU 了。

對 175B 參數的 GPT-3 進行完整微調對幾乎所有人來說都不可行——僅存儲就排除了它,更不用說 GPU 了。LoRA(低秩適應)是來自微軟研究院的技術,它默默地使 LLM 定製對我們其他人變得可行。它凍結了預訓練的權重,並將小型可訓練的秩分解矩陣注入到每個 Transformer 層中,可訓練參數減少達 10,000 倍,GPU 記憶體減少 3 倍,同時達到或超過完整微調的質量。

此演講解釋了為什麼 LoRA 有效——更新矩陣在適應期間的經驗秩不足——以及為什麼它在關鍵方面擊敗了適配器:低秩矩陣可以在推理時合併回基礎權重,因此沒有任何添加延遲。涵蓋了 RoBERTa、DeBERTa、GPT-2 和 GPT-3 的結果,以及實踐優勢:你現在可以實際上在單個消費 GPU 上微調大型模型,在運行時交換任務特定的適配器,並將它們作為小文件發布。如果你使用過 Hugging Face 的 PEFT 庫但沒有完全理解 LoRA 在底層做什麼,這是修復該問題的深度講座。