论文
面向GUI奖励建模的任务自适应量规
Task-Adaptive Rubrics for GUI Reward Modeling
摘要
近期关于GUI智能体的研究日益聚焦于结果奖励建模,即通过判断执行轨迹是否满足用户指令隐含的成功标准来分配结果奖励。然而,现有GUI奖励验证器往往对如何为每个任务实例构建这些标准规定不足。无论是使用通用量规结构还是隐式模型推理,其评判标准都不够任务自适应:它们可能把检查项跨任务迁移、忽视当前指令中的具体约束,或因强制执行未明确陈述的要求而变得过度严格。为解决这一局限,我们提出AdaptRubric,一个由粗到细的量规框架,通过类别级粗阶段和实例级细阶段构建任务自适应的评判标准。AdaptRubric先将指令路由到GUI任务族并检索可复用的任务族量规以完成类别级粗量规检索,然后进行实例级细量规生成,为当前指令中的具体数值、范围和约束提炼紧凑线索。在离线奖励评估和在线强化学习优化中,AdaptRubric持续优于以往的奖励智能体,在匹配图像预算下F1较基线平均提升3.6分,并带来4.23分的任务成功率增益。
