LoRA: allow a high school student to train Large Language Model (GPT-3) with a gaming graphics card

Tutorials

LoRA: 允许高中学生用游戏显卡训练大语言模型(GPT-3)

对175B参数的GPT-3进行完整微调对几乎所有人来说都是不可行的——仅存储就排除了这种可能性,更不用说GPU了。

对175B参数的GPT-3进行完整微调对几乎所有人来说都是不可行的——仅存储就排除了这种可能性,更不用说GPU了。LoRA(低秩适应)是来自微软研究院的技术,它悄悄地使LLM定制对我们其他人来说变得可行。它冻结预训练权重,并将小的可训练秩分解矩阵注入每个Transformer层中,将可训练参数减少多达10,000倍,GPU内存减少3倍,同时匹配或超越完整微调质量。

此演练解释了为什么LoRA有效——适应期间更新矩阵的经验秩不足——以及为什么它以关键方式击败适配器:低秩矩阵可以在推理时合并回基础权重中,因此没有额外延迟。涵盖了RoBERTa、DeBERTa、GPT-2和GPT-3的结果,以及实际收益:你现在可以在单个消费者GPU上实际微调大型模型,在运行时交换特定任务的适配器,并将其作为小文件发送。如果你使用过HuggingFace的PEFT库而没有完全理解LoRA在幕后做什么,这是修复这个问题的深入研究。