论文
StainFlow:GUI智能体过程奖励中的实体染色追踪与Evidence链接
StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents
摘要
强化学习 (RL) 已成为在长期、随机数字环境中改进 GUI 代理的一种有前途的方法,但轨迹级成功反馈太稀疏,无法为中间探索步骤提供可靠的信用分配。为了缓解这个问题,最近的研究引入了过程奖励模型(PRM),它通过全局里程碑验证或本地步骤级评估提供更细粒度的培训反馈。然而,这些方法仍然受到两个特定级别的限制:全局里程碑分解是主观的和单一的,使得难以适应真实GUI任务中的多个有效执行路径,而固定的局部判断窗口可能会错过远程关键证据或用不相关的帧稀释决策信号。受网络流分析中污点追踪机制的启发,我们提出了 StainFlow,一种用于 GUI 代理的实体污点流过程奖励模型。为了减少全局划分的主观性,我们引入了全局实体污点跟踪模块,该模块提取视觉上可验证的任务实体并跟踪它们的污点浓度和状态如何沿着轨迹演变,从而允许通过实体证据流的变化来客观地分离任务阶段。为了提高局部验证的准确性,我们引入了局部污点证据链接模块。以每个候选关键节点的触发实体为中心,根据其染色浓度和状态变化检索相关步骤,并动态构建高密度证据窗口以验证真正的关键节点。在AndroidWorld和OGRBench上的大量实验表明,StainFlow相对提高了在线RL成功率3.2%,轨迹完成判断准确率提高1.8%。
