论文

自我反思微调:从失败经验中增强智能体的安全性,抵御即时注入攻击

Self-Reflection Fine-Tuning: Enhancing Agent Security against Prompt Injection Attacks from Failure Experience

模型训练监督微调与指令调优

摘要

大语言模型 (LLM) 智能体越来越多地部署在工具增强环境中,但它们对外部输入的依赖使它们极易受到可劫持任务目标的提示注入攻击。现有的安全对齐方法依赖于静态专家轨迹或偏好优化,限制了它们推广到自适应攻击模式的能力。在这项工作中,我们提出了自我反思微调 (SRFT),这是一种训练框架,使智能体能够通过在对抗条件下学习自己的失败经验来提高鲁棒性。 SRFT 不是被动地模仿专家行为,而是将智能体暴露给通过注入攻击构建的受损轨迹,并利用专家模型生成结构化的自我反思推理,以对比不安全和最佳操作。这种反思性监督教会智能体识别恶意指令,推理其后果,并与原始用户意图保持一致。我们在基于 Llama-3.1-8B-Instruct 和 Qwen3-8B 构建的 SR-智能体中实例化该框架,并在静态和自适应提示注入基准上对其进行评估。实验结果表明,SRFT 在保持任务性能的同时大幅降低了攻击成功率,并且在自适应攻击下表现出很强的泛化能力。这些发现表明,通过自我反思从失败中学习是构建健壮且安全的LLM智能体的一个有前途的方向。我们的代码发布于https://github.com/Eden-Wang1710/srft-repo.

自我反思微调:从失败经验中增强智能体的安全性,抵御即时注入攻击的原论文方法或结果图
图 1:左:受监督的微调从固定的防御模式中学习,当遇到看不见的攻击时,这些模式可能会变得无效。右:自我反思微调从失败经验中学习,使其能够处理更广泛的攻击并识别以前未见过的攻击。