论文
RMSWeb:网页Agent强化学习中的反思、失效模式挖掘与Salvage-DS
RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning
摘要
小型网页Agent可降低部署成本,但训练同时面临数据采集和监督微调后的强化学习问题。成功轨迹采集昂贵,且常包含低效绕路;监督微调后,完整轨迹语料又被常规状态主导。网页动作使用组相对强化学习时,设计不当的动作级奖励会产生弱或误导性更新,不适合更新的组也缺少后备学习信号。我们提出RMSWeb,面向8B与32B的Qwen3-VL-Instruct,包含三个部分:根据反思进行重试,提高采集成功率并缩短成功轨迹;挖掘失败模式,将离线强化学习集中在微调策略暴露的关键状态;Salvage-DS结合动作语义的极化奖励、由对比度与能力门控的动态采样,以及为被拒绝组保留的仅动作锚点。用反思采集数据训练的策略,在解决任务时最多减少19.7%的动作步骤。在WebVoyager、Online-Mind2Web和WebTailBench上,RMSWeb相较监督微调在8B提升2.4—7.0个百分点,在32B提升1.2—7.7个百分点。8B模型在比较的同等规模开放权重模型中取得最高的已报告Online-Mind2Web成绩,并在另两个基准表现出领先的准确率—成本权衡,但外部评测协议存在差异。
