论文

VisCritic:视觉状态比较作为 GUI智能体 的过程奖励

VisCritic: Visual State Comparison as Process Reward for GUI Agents

模型训练奖励建模与过程监督

摘要

由视觉语言模型支持的 GUI智能体 显示出自动化数字任务的强大潜力,但由于缺乏步骤级验证,在长期场景中经常失败。现有的流程奖励模型仅通过文本推理来验证操作,忽略了 GUI 状态变化的视觉本质。我们引入了 VisCritic,一种视觉过程奖励框架,它通过直接比较视觉特征空间中的动作前和动作后屏幕截图来验证代理动作。 VisCritic 采用 Siamese 视觉 Transformer 来提取变化感知表示,并结合行动感知评价模型头来共同评估行动成功、任务进度和错误类型。评价模型训练数据构建管道从现有轨迹生成弱监督样本,无需额外的人工标签进行评价模型训练。五个基准测试的实验和离线分析表明,VisCritic 可作为各种 GUI智能体 的即插即用增强功能,通常可以改进基准指标,同时提供可视化诊断提示。