论文地址:https://arxiv.org/abs/2106.09685
LoRA (Low-Rank Adaptation) 是一种用于深度学习模型微调的方法,尤其是在大型预训练模型(如GPT、BERT等)中,LoRA 通过引入低秩矩阵来减少微调时的计算和存储开销,同时保持模型的表现力。
LoRA原理
LoRA的核心思想是,在微调大规模预训练模型时,传统方法需要对模型的所有参数进行更新,而LoRA则通过低秩矩阵近似来引入新的可训练参数,从而避免对整个模型参数的更新。
具体来说,LoRA在原始模型的权重矩阵 W W W中引入两个低秩矩阵 A A A 和 B B B,其中 W W W可以分解为:
W ′ = W + Δ W = W + A ⋅ B W' = W + \Delta W = W + A \cdot B W′=W+ΔW=W+A⋅B
其中, W W W是原始预训练模型的权重, Δ W = A ⋅ B \Delta W = A \cdot B ΔW=A⋅B是新增的低秩调整矩阵, A A A和 B B B的维度远小于 W W W,使得调整的参数数量大大减少。
- A A A和 B B B的秩(rank)通常是小的,因此可以通过这两个矩阵的乘积来对原始权重进行微小的调整。
- 这种方法避免了对原始权重矩阵的完全修改,仅需要训练低秩矩阵 A A A 和 B B B,从而减少了训练所需的存储和计算资源。
LoRA的优势
- 参数高效:LoRA通过引入低秩矩阵,大大减少了训练参数的数量,只更新低秩矩阵,而不更新模型的大部分参数。
- 高效计算:由于更新的是低秩矩阵,因此LoRA可以在保证精度的情况下显著减少计算资源的消耗。
- 与原始模型兼容:LoRA能够兼容任何已预训练的大型模型,进行微调时不需要重新训练整个模型,仅更新新增的低秩矩阵。
- 扩展性:LoRA不仅适用于语言模型,也适用于图像模型等大规模预训练模型。
LoRA代码实现
LoRA的代码实现通常包含以下几个关键部分:
- 定义低秩矩阵:需要为每个需要微调的层定义低秩矩阵 A A A和 B B B。
- 调整原始权重矩阵:将低秩矩阵与原始权重相加来得到新的权重。
- 训练低秩矩阵:在微调时,仅训练低秩矩阵 A A A和 B B B。
以下是一个简化的PyTorch实现:
import torch
import torch.nn as nn
class LoRALayer(nn.Module):
def __init__(self, original_weight, rank=4):
super(LoRALayer, self).__init__()
# 保存原始权重
self.original_weight = original_weight
# 定义低秩矩阵A和B
self.A = nn.Parameter(torch.randn(original_weight.size(0), rank)) # 随机初始化
self.B = nn.Parameter(torch.zeros(rank, original_weight.size(1))) # 0初始化
def forward(self, x):
# 使用低秩矩阵调整原始权重
adjusted_weight = self.original_weight + torch.mm(self.A, self.B)
return torch.nn.functional.linear(x, adjusted_weight)
# 示例:假设我们要微调一个线性层的权重
original_weight = torch.randn(128, 256) # 假设原始权重是 128x256 的矩阵
lora_layer = LoRALayer(original_weight)
# 假设输入数据 x
x = torch.randn(32, 256) # 假设输入数据是 32x256 的矩阵
output = lora_layer(x)
print(output.shape) # 输出应该是 (32, 128)
<


5045

被折叠的 条评论
为什么被折叠?



