论文

面向GUI奖励建模的任务自适应量规

Task-Adaptive Rubrics for GUI Reward Modeling

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

近期关于GUI智能体的研究日益聚焦于结果奖励建模,即通过判断执行轨迹是否满足用户指令隐含的成功标准来分配结果奖励。然而,现有GUI奖励验证器往往对如何为每个任务实例构建这些标准规定不足。无论是使用通用量规结构还是隐式模型推理,其评判标准都不够任务自适应:它们可能把检查项跨任务迁移、忽视当前指令中的具体约束,或因强制执行未明确陈述的要求而变得过度严格。为解决这一局限,我们提出AdaptRubric,一个由粗到细的量规框架,通过类别级粗阶段和实例级细阶段构建任务自适应的评判标准。AdaptRubric先将指令路由到GUI任务族并检索可复用的任务族量规以完成类别级粗量规检索,然后进行实例级细量规生成,为当前指令中的具体数值、范围和约束提炼紧凑线索。在离线奖励评估和在线强化学习优化中,AdaptRubric持续优于以往的奖励智能体,在匹配图像预算下F1较基线平均提升3.6分,并带来4.23分的任务成功率增益。

面向GUI奖励建模的任务自适应量规:论文配图
图1:任务自适应验证的动机示例。轨迹将一个相关的VS Code选项设为50,却遗漏了所要求的行长度设置。基线只验证表面值,而AdaptRubric构建由粗到细的准则,正确识别出该失败。