论文
行动之前,改变状态:欺骗性接口下WebAgent的前瞻性状态干预
Before Acting, Change the State: Prospective State Intervention for Web Agents under Deceptive Interfaces
摘要
基于 LLM 的 Web Agent可以自主完成用户任务,但欺骗性界面可能会引导它们产生与用户利益相冲突的结果。现有的防御措施主要通过阻止、引导或重新规划来干预Agent行为。我们确定了一种独特的失败模式:由于当前的 Web 状态,任务有效的操作仍然可以实现未经授权的结果。这促使将与任务相关的 Web 状态本身视为运行时控制目标。我们引入了 Veer,一种Agent端运行时防御,它将任务规划留给基础Agent,并在提议的操作会产生未经授权的结果时对 Web 状态进行干预。在修改实时环境之前,Veer 构建了一个朝向安全任务相关状态的前瞻性干预轨迹,并通过运行时基础和验证来执行它。在 TrickyArena 和 WebDecept 中,Veer 在所有三种评估设置中均实现了最高的安全任务完成率,在 TrickyArena-Single 和 TrickyArena-Multi 上分别超出了次佳防御 15.9 和 25.0 个百分点,同时将 WebDecept 上的暗模式成功率降低至 0.3%。这些收益在暗模式类型以及所有 12 种Agent、模型和基准配置中持续存在。消融表明,积极的国家干预提供了最大的收益,而预期的rollout和时间证据则贡献了额外的改进。这些结果将与任务相关的 Web 状态建立为有效的运行时控制目标,以保护 Web Agent免受欺骗性结果的影响。