LoRA: 고등학생도 게이밍 그래픽 카드로 대규모 언어 모델(GPT-3)을 훈련할 수 있게 하다
175B 파라미터 GPT-3의 전체 미세 조정은 거의 모든 사람에게 현실적이지 않습니다 — 저장 공간만으로도 불가능하며, GPU는 말할 것도 없습니다.
175B 파라미터 GPT-3의 전체 미세 조정은 거의 모든 사람에게 현실적이지 않습니다 — 저장 공간만으로도 불가능하며, GPU는 말할 것도 없습니다. Microsoft Research의 LoRA(저순위 적응)는 조용히 나머지의 LLM 맞춤화를 실현 가능하게 만든 기법입니다. 사전 훈련된 가중치를 고정하고 각 Transformer 계층에 작은 훈련 가능한 순위 분해 행렬을 주입하여, 훈련 가능한 파라미터를 최대 10,000배로, GPU 메모리를 3배로 줄이면서 전체 미세 조정 품질과 일치하거나 이를 능가합니다.
이 안내는 LoRA가 작동하는 이유 — 적응 중 업데이트 행렬의 경험적 순위 결손성 — 과 어댑터를 이기는 중요한 방식을 풀어냅니다: 저순위 행렬을 추론 시간에 기본 가중치에 다시 병합할 수 있으므로 추가 지연이 전혀 없습니다. RoBERTa, DeBERTa, GPT-2, GPT-3 전반의 결과와 함께 실용적인 이점들이 다루어집니다: 이제 단일 소비자 GPU에서 대규모 모델을 현실적으로 미세 조정할 수 있고, 런타임에 작업 특화 어댑터를 전환할 수 있으며, 작은 파일로 배포할 수 있습니다. HuggingFace의 PEFT 라이브러리를 LoRA가 후드 아래에서 무엇을 하는지 완전히 이해하지 못하고 사용했다면, 이것이 이를 수정하는 심화 강의입니다.
