论文

别点那个:教网页智能体抵抗欺骗性界面

Don't Click That: Teaching Web Agents to Resist Deceptive Interfaces

模型训练强化学习

摘要

基于视觉语言模型(VLM)的网页智能体展现令人印象深刻的自主GUI交互,但仍易受欺骗性界面元素攻击。既有方案要么在不集成任务的情况下检测欺骗,要么记录攻击而不提出防御。我们形式化欺骗感知的网页智能体防御,并提出DUDE(Deceptive UI Detector & Evaluator):两阶段框架,结合混合奖励学习与非对称惩罚及经验总结,把失败模式蒸馏为可迁移指导。我们引入RUC(Real UI Clickboxes):跨四域与欺骗类别的1,407场景基准。实验显示DUDE在保持任务性能的同时把欺骗易感性降低53.8%,为鲁棒网页智能体部署确立有效基础。

别点那个:教网页智能体抵抗欺骗性界面:论文配图
图 1:DUDE 概述。左:没有防御措施的特工屈服于欺骗;简单的拒绝会导致过度保护。右图:DUDE 通过混合奖励学习和经验总结实现校准评估。