LoRA:高校生がゲーミング用グラフィックスカードでLarge Language Model(GPT-3)を訓練できるようにする
175Bパラメータ数のGPT-3の完全な微調整は、ほぼ誰もが開始できない — ストレージだけでそれを除外し、GPUはおろか。
175Bパラメータ数のGPT-3の完全な微調整は、ほぼ誰もが開始できない — ストレージだけでそれを除外し、GPUはおろか。LoRA(Low-Rank Adaptation)は、Microsoft Researchの技術であり、LLMのカスタマイズを私たちの残りの部分に対して扱いやすくしました。それは事前訓練された重みを凍結し、各Transformerレイヤーに小さな訓練可能なランク分解マトリックスを注入し、訓練可能なパラメータを最大10,000倍削減し、GPUメモリを3倍削減しながら、完全な微調整品質と一致するか上回ります。
このウォークスルーは、LoRAが機能する理由 — 適応中の更新マトリックスの経験的ランク不足 — と、なぜそれがアダプタを重要な方法で上回るのかについてを展開します:ローランクマトリックスは推論時に基本的な重みに戻すことができるため、追加のレイテンシはありません。RoBERTa、DeBERTa、GPT-2、およびGPT-3全体の結果は、実用的な利益とともにカバーされています:単一のコンシューマGPUで大規模モデルを現実的に微調整し、ランタイムでタスク固有のアダプタを交換し、小さなファイルとして出荷できます。HuggingFaceのPEFTライブラリを使用したが、LoRAが実際に何をしているのかを完全に理解していない場合、これはそれを修正する深いダイブです。
