论文
CoER:通过对抗性共同进化和细化防御自适应间接快速注入
CoER: Defending against Adaptive Indirect Prompt Injection via Adversarial Co-Evolution and Refinement
摘要
语言模型代理在工具使用过程中容易受到间接提示注入(IPI)的攻击:隐藏在不受信任的工具输出中的对抗性指令可以秘密地重定向合法的任务执行。现有的工作经常训练和评估针对不适应防御者行为的固定攻击的防御,因此由此产生的防御可能难以抵抗自适应攻击。我们将自适应攻击者-防御者联合训练与后续改进相结合:持续的交互可以改善两个角色,而学习的攻击者则提供训练挑战,以进一步提高防御者的安全性和任务效用。因此,我们将自适应 IPI 建模为一般和马尔可夫博弈:防御者通过连续的工具调用推进任务,而攻击者可以在同一任务中多次注入,并使后续攻击适应防御者的响应。在此基础上,我们提出了 CoER,一个基于验证者的共同进化和细化框架。在从成功的轨迹中初始化攻击者后,Co-PPO 保留了作为对手群体的历史策略,并将当前和历史对手混合在一起进行双边强化学习,将训练扩展到最新的比赛之外。然后,来自这些群体的攻击者被重新用来挑战教师代理,并且只有经过安全性和任务完成验证的演示才能用于微调共同进化的防御者。在我们的主要七域评估中,CoER 将观察到的总体攻击成功率从 38.5% 降低到 0.2%,并将任务效用从 63.2% 提高到 76.3%,并提高了对外部基准的攻击抵抗力。