论文

LLM 后训练 中的顺序数据中毒

Sequential Data Poisoning in LLM Post-Training

模型评测安全与风险评测

摘要

LLM 后训练 通过多个阶段进行,例如,受监督的 微调 (SFT),然后是来自人类反馈的强化学习 (RLHF) 或直接偏好优化 (DPO),其中每个阶段从不同的、可能不可信的来源提取数据。现有文献假设数据中毒攻击可能在每个训练阶段发生,但忽略了多个攻击者的可能性。为了研究整个 后训练 管道的可信度,我们提出了顺序数据中毒的威胁模型,其中多个对手分别毒害 SFT 和偏好数据集。在这种威胁模型下,我们识别出单一攻击者的错觉:单独评估的每个对手似乎构成的威胁可以忽略不计。然而,当对手跨阶段合作时,真正的漏洞就会暴露出来。在 SFT $\to$ DPO 管道中,它们的贡献是累加性的:将固定的毒物预算划分到各个阶段比单独集中在任一阶段的效果要好。在 SFT $\to$ PPO 管道中,它们的贡献是互补的:SFT 和奖励模型中毒都不能单独成功,但它们的组合却可以成功。这些发现表明,对各个 后训练 阶段的安全分析系统性地低估了仅在其交互中出现的复合漏洞。代码可在 https://github.com/jcksanderson/sequential-poisoning 获取。