论文
AdvSim2Real:在世界模型中对抗训练网页 Agent
AdvSim2Real : Training Web Agents Against Adaptive Prompt Injection in a Web World Model
摘要
Web 智能体通过读取第三方编写的页面并对其进行操作来完成用户请求,因此植入到页面上的指令可以将智能体重定向到远离用户目标的方向。 智能体不能简单地忽略该页面,因为该页面还保存任务所需的值和控制。当前的防御措施微调和智能体在训练之前已修复,而适应训练模型的攻击者则绕过它们。对抗性训练让攻击者适应但保持任务固定,因此一旦智能体解决任务,任务就会停止教学。我们引入了 AdvSim2Real,它在冻结的网络世界模型中共同进化了任务课程、注入对手和智能体。课程对智能体解决了大约一半时间的任务进行奖励,而对手只对成功翻转(将判断的成功变成失败的注入)进行奖励。模拟器中的训练使 4B 智能体的能力更强、更稳健:无论是否受到攻击,它的完成度都会提高,能够对抗从未训练过的前沿模型对手,并且其能力增益可以转移到真实的浏览器上。在 150 个 Web 任务中,相对于基础智能体,AdvSim2Real 在这个看不见的对手下将完成度提高了 33.6%。
