论文

LLM 的联邦 微调 上的图表示学习增强模型操作

Graph Representation Learning Augmented Model Manipulation on Federated Fine-Tuning of LLMs

模型评测安全与风险评测

摘要

联合 微调 (FFT) 已成为协作适应 大语言模型 (LLM) 的隐私保护范例。基于联邦学习,FFT 使分布式代理能够通过聚合本地 LLM 更新来共同完善共享的预训练 LLM,而无需共享本地原始数据。然而,基于 FFT 的 LLM 仍然容易受到模型操纵威胁,其中敌对参与者上传受操纵的 LLM 更新,从而破坏聚合过程并降低全局 LLM 的性能。在本文中,我们提出了针对基于 FFT 的 LLM 的增强模型操纵(AugMP)策略。具体来说,我们设计了一种新颖的图表示学习框架,该框架捕获良性 LLM 更新之间的特征相关性,以指导恶意更新的生成。为了提高操纵有效性和隐蔽性,我们开发了一种基于增强拉格朗日对偶公式的迭代操纵算法。通过这种表述,恶意更新被优化以嵌入对抗性目标,同时保留良性的参数特征。多个 LLM 主干网的实验结果表明,AugMP 策略在所有竞争基线中实现了最强的操纵性能,将全局 LLM 准确率降低了 26%,并将本地 LLM 代理的平均准确度降低了 22%。同时,AugMP 通过良性更新保持了高度的统计和几何一致性,使其能够逃避传统的基于距离和相似性的防御方法。