论文
SCA:GUI Agent强化学习的空间信用分配
SCA: Spatial Credit Assignment for Reinforcement Learning of GUI Agents
摘要
GUI Agent通过将语言指令置于可视化界面中,自动执行数字设备上的任务。现有的组相关强化学习通过比较从同一 GUI 状态采样的多个响应的奖励来改进 GUI 动作预测。然而,二元评估将空间上不同的失败点击视为相同,并且当所有采样点击失败时不提供相对信号。为了解决这些限制,我们提出了空间信用分配(SCA),它使用采样点击的屏幕坐标来细化相对于组的信用。具体来说,SCA 从包含成功和失败的组中的其他响应中预测每个保留响应的奖励,然后使用预测残差来调整信用。当所有采样的点击失败时,SCA 会根据距注释目标的距离对它们进行排序。这些空间参考仅用于构建训练更新;部署的政策保持不变。我们通过将其误差和方向对齐与受控综合研究中的精确返回梯度进行比较来评估这种修正是否改善了策略更新本身。在 GUI 基础和离线动作预测基准测试中,SCA 改善了跨专业领域的基础,并在大多数动作预测指标的强化微调模型中取得了最强的结果,并且在报告的 GUI 套件中获得了一致的收益。