论文
别点那个:教网页智能体抵抗欺骗性界面
Don't Click That: Teaching Web Agents to Resist Deceptive Interfaces
摘要
基于视觉语言模型(VLM)的网页智能体展现令人印象深刻的自主GUI交互,但仍易受欺骗性界面元素攻击。既有方案要么在不集成任务的情况下检测欺骗,要么记录攻击而不提出防御。我们形式化欺骗感知的网页智能体防御,并提出DUDE(Deceptive UI Detector & Evaluator):两阶段框架,结合混合奖励学习与非对称惩罚及经验总结,把失败模式蒸馏为可迁移指导。我们引入RUC(Real UI Clickboxes):跨四域与欺骗类别的1,407场景基准。实验显示DUDE在保持任务性能的同时把欺骗易感性降低53.8%,为鲁棒网页智能体部署确立有效基础。
