论文
AsyncWebRL:多步可视化 Web 代理的高效异步强化学习
AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents
摘要
使用多步骤 RL 训练视觉语言 Web 代理属于计算密集型工作,存在两种主要的低效率形式:同步 RL 中的空闲 GPU,以及使用不必要的步骤和标记的轨迹。我们提出了 AsyncWebRL,它解决了这两个问题。在系统方面,异步设计在迭代中重叠了执行轨迹、梯度更新和策略刷新,并与两个特定于 Web 代理的适应相结合,即永久执行轨迹池和轻量级屏幕截图处理,与之前最快的开放同步管道 (WebGym) 相比,它们共同提供高达 2.9倍 的端到端训练吞吐量加速。在算法方面,我们将多步 GRPO 中的每轨迹归一化器 $1/|τ_i|$ 确定为轨迹级别和 词元级 低效率的根本原因:因为失败的时间比成功的系统时间长,所以它降低了失败词元上的负梯度的权重,因此该策略不断产生详细的内存模式。将 $1/|τ_i|$ 替换为常数 $1/k$ 会打破这种耦合,在保持总体成功的同时收缩轨迹。这些贡献共同创造了 WebGym 分布外测试分割的新开源技术水平(相对于之前最好的 42.9% 增加了 5.8%),其中较难的切片收益最大(相对于中级增加了 42%,相对于硬性增加了 48%)。