论文
选择你的毒药:学习选择毒药集以实现更强的 LLM 后门攻击
Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks
摘要
后门中毒攻击将中毒的示例添加到原本干净的微调数据中,将触发器与模型在触发器出现时学习产生的目标行为配对。现有的评估通常会固定中毒示例的数量,并从候选池中随机抽样。我们表明,这可能会严重低估最坏情况的漏洞:在三个 LLaMA-3-8B 后门设置中,保持模型、干净数据和毒物计数固定,攻击成功率从 3% 到 80% 不等,仅取决于选择的毒物集。我们将毒物选择形式化为预言机预算集优化,并引入了 SAILS(集级审计通知迭代学习选择),它从数百次微调和评估运行中学习集评分器,对数百万个候选集进行排名,并仅审核一小部分候选集。 SAILS 比最强影响基线平均提高了 30 个百分点的持续攻击成功率,从小规模微调转向全面微调,并扩展到代码生成、代理和仅 API 后门。