论文

WAR:同步代理强化学习的工作负载感知部署

WAR: Workload-Aware Rollouts for Synchronous Agentic Reinforcement Learning

AI 基础设施推理服务

摘要

长期部署生成已成为代理强化学习(RL)中的主要系统瓶颈。随着智能体与环境交互多次,轨迹迅速增长到数以万计的标记,使得同步强化学习训练越来越受到部署的限制。我们提出了 WAR,这是一种工作负载感知的轨迹采样系统,它通过联合优化解码和调度来显着加速同步代理强化学习。 WAR 建立在一个关键观察的基础上:最佳的轨迹采样优化策略取决于运行时负载:(1) 在低负载下,WAR 通过 SuffixDecoding 启用无模型 推测解码,后者重用之前完成的轨迹中的后缀模式作为未来轨迹采样的推测草案。与基于模型的绘图器不同,SuffixDecoding 不引入额外的绘图模型,并避免与轨迹采样生成发生 GPU 争用。 (2) 在高负载下,饱和批量解码留给推测加速的空间有限,WAR 将优化重点转移到缓存感知调度。全局调度程序根据缓存位置、轨迹进度和服务器负载在转出副本之间放置请求,从而减少冗余 KV 缓存重新计算并缓解负载不平衡。通过将解码级后缀重用与系统级部署调度相结合,WAR 在不改变底层 RL 算法的情况下,跨工作负载机制提供了强大的吞吐量改进。 WAR 在低负载下将长上下文代理轨迹采样吞吐量提高了 1.4 倍,在高负载下提高了 1.6 倍。这些结果表明,WAR 消除了同步代理强化学习中的主要部署瓶颈,并为可扩展的长上下文代理训练提供了一条实用途径。