论文

锚定偏差:持续学习下针对 MLLM 的持续公平后门攻击

Anchoring Bias: A Persistent Fairness Backdoor Attack against MLLMs under Continual Learning

模型评测安全与风险评测

摘要

多模式 大语言模型 (MLLM) 越来越多地部署在高风险领域,其中公平性是关键的安全要求。在实践中,这些模型通过持续学习(CL)不断更新,以适应不断变化的任务和数据分布。先前的研究表明,后门攻击可以通过隐藏的触发器操纵 MLLM 响应,但天真的植入的后门会随着模型进行后续 CL 更新而降级。尽管公平性已成为 MLLM 部署的核心问题,但后门引发的公平性违规是否能够在 CL 中幸存尚待探索,这留下了两个尚未解答的关键问题:(1) 后门是否能够可靠地引发 MLLM 中的公平性违规,以及 (2) 这种以公平为目标的后门是否可以通过持续学习持续存在。我们通过提出持久公平后门攻击 (PFBA) 来弥合这一差距,以向 MLLM 注入持久且针对特定群体的歧视。具体来说,PFBA 通过两种新颖的机制实现了这一目标。潜在空间公平强化通过锚定特权组表示来保留效用,同时排斥和聚类目标组表示以维持歧视,从而重塑模型的深层特征几何,持续学习模拟迭代优化针对模拟参数漂移的触发器,以确保后门在未来更新中的持久性。大量实验表明,PFBA 会导致严重的公平差异,这种差异在持续的学习轮次中持续存在,从而规避了标准的后门防御。数据和代码可在 https://github.com/lyygua/PFBA 上公开获取。