论文

GUI智能体相信自己的眼睛吗:诊断对像素与结构的状态信念依赖

Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure

模型评测模型行为与机制分析

摘要

多模态GUI智能体通过两条冗余通道读取界面:截图的渲染像素与序列化结构(如文档对象模型或无障碍树)。行动前——智能体对当前界面状态形成信念——但既有基准评分任务成功、元素定位或攻击抗性——不问该信念是否来自像素。我们形式化视觉状态依赖——将状态信念归因于像素、结构或先验——并用跨735个探针(覆盖真实web、移动与桌面界面——其中225个从活体生产网站挖掘的零编辑分歧)的成对单通道干预测量——全部以确定性强制选择评分、无模型裁判。核心指标是感知-融合缺口(PFG)——模型感知正确却在冲突时倒向结构的探针比例;在目标区域紧裁剪上重新验证感知的更严格变体使缺口保持不变。跨四厂商模型——文本状态信念倒向结构——而纯图像准确率接近上限——且在活体页面的未编辑过期快照上——同一模型在多达0.88的探针上遵循过期结构。白盒消融将文本效应追溯到单个被复制的结构值——梯度归因显示视觉证据被处理却被否决。在活体多步环境中——第一步的一个错误来源信念级联为任务失败——自我恢复率至多0.03。在相同探针上比较四种缓解:提示级线索在动作层失败——证书检查以拒绝为代价买安全——免训练一致性门是唯一同时降低劫持与任务错误的方法。视觉状态依赖由此给出智能体状态信念是否视觉定位的可测量诊断。

GUI智能体相信自己的眼睛吗:诊断对像素与结构的状态信念依赖:论文配图
图 1:核心场景,来自 Multimodal-Mind2Web 的真实探测(Deng 等人 2023)。相同的界面状态通过两个通道到达代理:渲染的像素 PP(突出显示的控件读取“预订”的屏幕截图)和序列化结构 SS(我们编辑以读取“预算卡车”)的 DOM 节点。仅从像素中读取,代理就能正确回答预订,但其融合信念遵循编辑后的结构。我们将这种正确感知但延迟探测的比例报告为感知融合差距 pfg,即我们的中心指标。