论文
TideRL:通过就绪感知调度提高 Agentic RL 吞吐量
TideRL: Boosting Agentic RL Goodput with Readiness-Aware Scheduling
摘要
大语言模型 的强化学习 (RL) 正在转向多轮代理工作负载,其中执行轨迹采样任务会针对外部环境反复暂停,随着上下文的增长而恢复,并在高度可变的时间完成。在此设置中,通过训练吞吐量衡量的 RL 训练有效吞吐量比原始 GPU 占用率更重要:GPU 等待和重复的预填充重新计算是纯粹的开销。我们推出了 TideRL,这是一种具有连续任务批处理、资源感知 Ref-Actor 管道和弹性资源扩展功能的就绪感知弹性 RL 系统。 CTB 保留有用的轨迹采样状态,$\textrm{RA}^2\textrm{P}$ 根据就绪积压和到达间隔在解耦流式传输和共置聚合之间进行选择,ERS 使用相同的就绪信号在轨迹采样和训练之间调配计算进程。在纯文本和多模式代理工作负载中,TideRL 将 RL 训练吞吐量比同步基线提高了 5.6$\times$,比异步基线提高了 33% 以上,同时达到了类似的任务性能。它还将 KV 缓存命中率提高了 1.58$\times$,将每步训练时间减少高达 44.3%,并将总等待时间减少高达 77.6%。