论文

面向计算机使用智能体的历史感知视觉定位批评者

A History-Aware Visually Grounded Critic for Computer Use Agents

智能体系统Agent 动作执行与治理

摘要

计算机使用代理 (CUA) 的各种测试时干预措施(包括批评模型)已被开发出来,以通过复杂的图形用户界面 (GUI) 环境中的预执行操作评估来提高性能。然而,现有的批评者面临两个关键的限制:他们(1)主要关注短视的决策循环(例如,忘记之前的操作)和(2)缺乏检测有缺陷的操作所需的视觉定位依据(例如,单击错误的 UI 元素)。为了解决这些问题,我们引入了 HiViG,一个历史感知的视觉定位依据测试框架,围绕一个经过真实 GUI 轨迹训练的多模态批评家构建,将过去的交互抽象为紧凑的记录,并通过视觉定位依据评估动作。在测试时,HiViG 将批评家集成到政策决策循环中,以提供宏观行动历史记录(总结政策已完成的成就)和基于视觉的批评(根据当前屏幕截图验证原始执行坐标,以在执行前拦截错误)。在网络、移动和桌面基准测试中,HiViG 始终优于现有的标量和口头批评者,将 Qwen3-VL-32B 的平均成功率提高 5.8%,将 Gemini-3-Flash 的平均成功率提高 9.0%,并表现出强大的跨平台泛化能力。消融表明,宏观操作历史可以减轻短视的规划,基于视觉的批评可以减少执行错误,这两个组件对于长期 GUI 任务中的测试时间扩展至关重要。

面向计算机使用智能体的历史感知视觉接地批评者:论文配图
图 1:计算机使用代理 (CUA) 测试时干预的比较。左:由于缺乏历史意识和主动错误恢复,标准政策很容易陷入短视的决策循环。右:现有方法有限。当所有候选行动均次优时,标量反馈(顶部)会将策略陷入低奖励轨迹区域。以前的批评者(中)严重依赖文本意图,遗漏了空间和推理错误,并且未能提供历史意识。相比之下,我们的批评家(底部)验证原始执行坐标,根据其学习的状态转换知识预测即时视觉状态结果,并提供基于视觉的错误分析,在执行前拦截错误。此外,它还为智能体配备了历史状态跟踪功能,浓缩过去的交互,引导他们实现最终的任务目标。