论文

正确的屏幕,错误的转换:世界模型作为 GUI 代理的验证者

Right Screen, Wrong Transition: World Models as Verifiers for GUI Agents

智能体系统模型评测Agent 动作执行与治理Agent 环境交互安全与风险评测

摘要

点击“登录”后,预计会出现登录屏幕;点击“查看订单”后出现同一屏幕是一种攻击。因此,对于 GUI 代理来说,安全性是转换的属性,而不是屏幕的属性,并且可以通过重用合法的监视器来击败仅检查屏幕的监视器。判断转变需要对行动之后应该发生的事情有一个预期。现有的 GUI 世界模型提供了一个,但它们将其输出为文本、代码或图像,因此根据观察到的屏幕检查它需要第二个模型来判断两者。我们认为,用于验证的世界模型应该在观察编码的空间中进行预测,并提出 LGWM,这是一种无解码器、动作条件的世界模型,可以直接预测下一个屏幕的表示,在 1.85M 真实 GUI 转换上进行训练,无需语义注释。验证简化为向量比较,相同的信号揭示不匹配是否有害。我们对 RSWT-BENCH 进行评估,这是一种诊断,其中每个凭据屏幕都出现在合法和被劫持的情况下 过渡,因此只能看到屏幕的探测器是有可能因构造而出现的。免训练得分在每个决策 17 毫秒时达到 0.987 AUC,与最强的闭源 VLM 相当,并且比生成 GUI 世界模型高出约 10 个 AUC 点,延迟降低了三个数量级以上。在区分有害和良性违规时,残差方向达到 0.953 AUC,其中提示的 VLM 几乎是偶然的。进一步的分析表明,预测是一个可用的未来状态,而不是一个异常分数。世界模型主要用作模拟器或规划器;我们的结果指出了第三个角色,即验证,在表示空间中进行预测是自然的设计。