论文

AdvSim2Real:在世界模型中对抗训练网页 Agent

AdvSim2Real : Training Web Agents Against Adaptive Prompt Injection in a Web World Model

模型评测安全与风险评测

摘要

Web 智能体通过读取第三方编写的页面并对其进行操作来完成用户请求,因此植入到页面上的指令可以将智能体重定向到远离用户目标的方向。 智能体不能简单地忽略该页面,因为该页面还保存任务所需的值和控制。当前的防御措施微调和智能体在训练之前已修复,而适应训练模型的攻击者则绕过它们。对抗性训练让攻击者适应但保持任务固定,因此一旦智能体解决任务,任务就会停止教学。我们引入了 AdvSim2Real,它在冻结的网络世界模型中共同进化了任务课程、注入对手和智能体。课程对智能体解决了大约一半时间的任务进行奖励,而对手只对成功翻转(将判断的成功变成失败的注入)进行奖励。模拟器中的训练使 4B 智能体的能力更强、更稳健:无论是否受到攻击,它的完成度都会提高,能够对抗从未训练过的前沿模型对手,并且其能力增益可以转移到真实的浏览器上。在 150 个 Web 任务中,相对于基础智能体,AdvSim2Real 在这个看不见的对手下将完成度提高了 33.6%。

AdvSim2Real:在世界模型中对抗训练网页 Agent:论文原图
图 5:按层划分的干净完成情况、每次更新的任务更改以及在攻击下干净的胜利损失。 (a) 按技能层和检查点的干净判定完成率 (%),平均超过三名种子;任务计数在括号内。 (b) 每次更新后对三个种子的良好判断数量增加或减少的任务(省略关系)。 (c) 干净良好的任务和被攻击事件被判定为不良的种子对的份额,相对于稳健迭代 3 的基础。