TriShield:通过正交梯度投影和优化器状态纠缠在联邦语言模型 微调 中零效用损失防御隐私后门
TriShield: Zero-Utility-Loss Defense Against Privacy Backdoors in Federated Language Model Fine-Tuning via Orthogonal Gradient Projection and Optimizer State Entanglement
摘要
大语言模型 (LLM) 的联合 微调 可以在不暴露原始数据的情况下进行协作训练。然而,最近的一次攻击 NeuroImprint 表明,恶意参数服务器可以将 PEFT 适配器破坏为隐私后门:通过为每个训练样本分配专用记忆神经元并确保每个神经元最多更新一次,服务器可以以高语义保真度分析重建 59%--79% 的客户端训练数据。现有的防御措施——包括本地差分隐私(LDP)和梯度裁剪——要么无法抵御这种攻击,要么造成不可接受的效用下降。我们提出了 \textbf{TriShield},这是一种三层确定性防御,可以完全防止 NeuroImprint 式重建,模型效用损失为零,并且无需额外的通信轮次。 TriShield 包括:(1) 参数伪影检测器,用于在本地训练开始之前识别分布式模型参数中的记忆神经元特征; (2) Stateful Virtual Iteration}机制,迫使 Adam/AdamW 的动量状态不可逆地纠缠虚拟步骤中的梯度,从而使 NeuroImprint 的封闭式反演失效; (3) 零效用正交投影算子,将所有局部梯度更新投影到通过 SVD 计算的主任务语义子空间上,从物理上消除任何带有私有记忆的梯度分量。我们从理论上证明,在第 2 层和第 3 层之后,上传的梯度与任何单个训练样本之间的互信息为零。 GPT-2 (117M) 和 Llama-Guard-3-1B 上的实验验证了 TriShield 在所有测试的攻击变体中将 NeuroImprint 重建率降低至 0%,同时保持或提高训练准确性,额外 GPU 计算开销不到 5%。