论文

针对质量多样化 Web 代理模仿的推测性回滚修正

Speculative Rollback Correction for Quality-Diverse Web Agent Imitation

模型训练合成数据

摘要

通过专家轨迹的模仿学习来训练交互式网络代理已成为一种非常有效的方法。然而,在这种情况下,确定专家干预的最佳时机提出了严峻的挑战。延迟干预通常会导致早期错误的累积,将页面状态推入不可恢复的状态。相反,过早或过度的干预会导致智能体过度依赖专家策略,使模型陷入以单一、刚性轨迹为特征的局部最优状态。我们提出了推测回滚校正(SRC),这是一种用于可重置代理环境的分支级模仿框架。 SRC 不再要求教师在每个访问的状态进行标记或仅在完成轨迹后进行纠正,而是使用固定范围分支审查:学生在教师审查之前执行一个简短的推测部分,并且教师仅在局部进度中断时才定位第一个有害偏差。回滚保留有用的前缀,而成功的执行轨迹则由硬验证器过滤并保留在轻量级质量多样性存档中。生成的数据支持局部校正和验证者通过轨迹上的下一步操作监督 微调。在 WebArena-Infinity 上,SRC 收集了 977 个验证者通过轨迹和 9,183 个下一步操作示例;与步骤级审核相比,固定范围审核改进了恢复与查询的权衡,同时保留了验证者通过的解决方案变体。代码可在 https://github.com/LongkunHao/SRC_gui_agent 获取。