论文
FedLNS:利用 LayerNorm 签名建模来减轻联邦 LLM 中的对抗性操纵
FedLNS: Leverage LayerNorm Signature Modeling to Mitigate Adversarial Manipulation in Federated LLMs
摘要
联合训练使语言模型能够从分布式私有文本中学习,但服务器无法直接验证产生每个客户端更新的本地监督或优化过程。因此,恶意客户端可以在损坏的目标上进行训练,引入不正确的上下文词元关联,并通过重复聚合来降低全局模型的性能。这种退化还会增加不可靠或产生幻觉的风险。我们提出了带有标准化签名的联合学习(FedLNS),这是一种用于轻量级恶意更新筛选的服务器端框架。 FedLNS 通过可训练标准化层参数的更改来表示每个客户端更新,并根据强大的、历史感知的跨客户端参考筛选可疑更新。由于签名是在服务器上从返回的本地模型中提取的,因此与标准联邦学习 (FL) 方法相比,FedLNS 不需要额外的客户端到服务器参数或元数据交换。筛选后,可以使用标准 FL 或其他兼容的聚合规则来聚合保留的全模型更新。 FedLNS 不需要原始客户端数据、可信服务器数据集、标记的攻击示例或单独训练的检测器。对 200 个客户端从头开始训练的 GPT 式、BERT 式和 LLaMA 式模型的实验表明,在 40% 的群体水平目标操作下,FedLNS 在 IID(独立同分布)和非 IID 数据分区下,所有三种架构的测试困惑度都低于六个基线中最强的一个。