论文

MineGrad:针对LoRA微调的梯度反演攻击

MineGrad: Gradient Inversion Attacks on LoRA Fine-Tuning

模型评测安全与风险评测

摘要

参数化高效的微调(PEFT),如低秩适应(LoRA),在最近的联邦学习中被采用,以减少通信和计算成本。在这种设置中,用户在微调之前从服务器下载预训练模型,并在本地微调轻量级的LoRA模块,同时将预训练模型冻结,仅与服务器共享微调参数的梯度。尽管其受欢迎程度日益增加,但联邦微调在对抗性服务器上抵御攻击的鲁棒性仍未得到充分探索,其中服务器恶意地篡改训练协议,以侵犯用户数据的隐私。在这项工作中,我们研究了LoRA微调中的梯度逆向攻击。我们提出了一种分析性攻击,使恶意服务器利用受污染的预训练模型和微调参数,以恢复私有用户数据。我们的设计将微调数据嵌入共享梯度中,以便服务器可以分析性地重建用户数据。与之前的工具有关,我们的攻击适用于语言和视觉任务,无需使用公共数据集的昂贵(对抗性)预训练或要求训练样本数少于LoRA模块的秩。在语言和视觉任务上的实验结果展示了在多个基准上的高保真数据恢复,揭示了几个关键的脆弱性。

MineGrad:针对LoRA微调的梯度反演攻击:论文配图
图1:包含 LoRA 模块的 Transformer 编码器。编码器由堆叠的多头自注意力(MSA)、LayerNorm、MLP 层及残差连接组成。在每个 MSA 层中插入秩为 r 的低秩矩阵 A 和 B。