论文

针对联合 大语言模型 的高效成员推理攻击:投影残差方法

Toward Efficient Membership Inference Attacks against Federated Large Language Models: A Projection Residual Approach

模型评测安全与风险评测

摘要

联合 大语言模型 (FedLLM) 使多方能够协作微调 LLM,而无需共享原始数据,从而解决有限资源和隐私问题的挑战。尽管数据本地化,共享梯度仍然可以通过成员推理攻击(MIA)暴露敏感信息。然而,FedLLM 的独特属性,即大量参数规模、快速收敛以及稀疏、非正交梯度,使得现有的 MIA 无效。为了解决这一差距,我们提出了 ProjRes,这是第一个为 FedLLM 量身定制的基于投影残差的被动 MIA。 ProjRes 利用隐藏的嵌入向量作为样本表示,并分析它们在梯度子空间上的投影残差,以揭示梯度和输入之间的内在联系。它不需要影子模型、辅助分类器或历史更新,确保了效率和鲁棒性。在四个基准测试和四个 LLM 上进行的实验表明,ProjRes 的准确率接近 100%,比之前的方法高出 75.75%,即使在强大的差分隐私防御下也仍然有效。我们的研究结果揭示了 FedLLM 中以前被忽视的隐私漏洞,并呼吁重新审查他们的安全假设。我们的代码和数据可在 $\href{https://anonymous.4open.science/r/Passive-MIA-5268}{link}$ 获取。