论文
梯度幻影:大语言模型 分割学习中可训练但标签无法识别的梯度
Gradient Mirage: Trainable yet Label-Unidentifiable Gradients in Large Language Model Split Learning
摘要
LLM 分割学习 (SL) 中的梯度匹配攻击 (GMA) 依赖于一个关键但尚未充分探索的假设:分割界面处暴露的梯度是客户端全标签训练目标的忠实派生。这种梯度目标一致性允许好奇的服务器通过搜索其诱导梯度解释观察结果的序列来恢复私有标签。我们提出了梯度幻影(Gradient Mirage),这是一种打破这种一致性的防御方法,同时又不放弃后向信号的优化效用。我们的关键思想是诱导对手解决错误指定的逆问题,其中序列空间中没有合理的标签序列可以解释观察到的梯度。具体来说,梯度幻影通过在目标、方向和规模三个维度上引入不一致来实现这一目标。选择性自回归监督从掩盖的代理损失中得出暴露的梯度,而不是攻击者假设的全标签目标;然后,Scale Blinding 应用随机乘法重新缩放,模糊梯度的自然大小;定向私有化在定向度量差分隐私保证下通过冯·米塞斯-费舍尔(vMF)机制进一步随机化梯度方向,同时保留其大小。至关重要的是,保留了实用性:顶部分段仍然通过双轨反向传播从所有目标标记中学习,暴露的梯度仍然提供信息,因为每个监督标记保留其完整的自回归上下文,底部梯度恢复恢复底部分段优化的有效梯度。大量实验表明,在类似的 微调 性能下,Gradient Mirage 提供了比现有防御更强的保护,实现了更好的隐私与实用权衡。