论文

面向桌面GUI智能体的动作诱导视觉差异反思

Reflection with Action-Induced Visual Differences for Desktop GUI Agents

智能体系统Agent 环境交互

摘要

Planner-Operator-Reflector(POR)框架被广泛用于GUI智能体,通过模块化协作在复杂任务中维持目标对齐。然而,桌面GUI引入了一个关键挑战:大而密集的界面常常呈现细微或分散的状态变化,把大部分负担压在反思器(reflector)上——它必须比较动作前后的屏幕——而规划器和操作器仅基于单一状态推理。现有反思器把变化检测与结果验证压缩为一步,证据保持隐式,导致决策依据薄弱。为解决这一局限,我们提出证据优先反思(Evidence-First Reflection, EFR),一个两阶段反思器,显式解耦动作诱导视觉差异的提取与结果验证。EFR通过Set-of-Marks标注识别动作位置和候选变化区域,描述并过滤与动作相关的变化,再基于清洗后的证据做出最终判断。这种证据-推理解耦设计使反思更好地扎根于屏幕变化,同时降低视觉搜索复杂度与推理负担。在OSWorld-Verified和WindowsAgentArena上的实验表明,EFR将反思器准确率提升7.11%,并在两个基准上分别带来5.94%和4.95%的平均端到端任务成功率增益。

面向桌面GUI智能体的动作诱导视觉差异反思:论文配图
图3:POR框架中EFR的概览。给定动作前截图S_pre、动作后截图S_post、接地动作描述A_ground与意图动作描述A_intend,EFR先用SoM标注候选视觉差异与动作位置,再过滤与动作相关的证据,最后基于清洗后的证据判断动作是否成功。