论文
检测、遗忘、恢复:保护文本摘要模型免受数据中毒
Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning
摘要
微调 期间的训练时数据中毒对部署用于抽象文本摘要的 大语言模型 (LLM) 构成重大威胁,其中小型任务特定数据集对模型行为产生不成比例的影响。在此设置中,攻击者操纵 微调 数据来引发持续的摘要失败,例如有偏见或有害的摘要,同时保留标准评估指标。我们提出了一个统一的事后防御框架,用于检测和修复整个机器学习供应链的汇总模型中的 微调 阶段中毒。我们的实验表明,在白盒设置中,中毒的文档摘要对表现出异常高的训练影响,从而可以通过影响函数分析和语义一致性检查进行检测。在黑盒设置中,中毒模型对语义保留扰动的敏感度提高了两到三倍,从而无需训练数据访问即可进行行为审计。除了现有的中毒公式之外,我们还引入了针对事实扭曲和代表性偏见的新颖攻击,表明中毒会改变摘要行为而不触发传统警报。在自适应攻击下的九个架构和六个基准数据集上,我们的防御实现了 85-92% 的检测精度,而梯度上升取消学习以最小的效用损失(小于 0.6% ROUGE 退化)恢复了高达 96% 的原始行为。这些结果表明,微调 时间中毒留下了持久的结构伪影,无需完全重新训练即可实现实际检测和部署后恢复。