论文
Heddle:面向Agent强化学习轨迹采样的分布式编排
Heddle: A Distributed Orchestration System for Agentic RL Rollout
摘要
代理强化学习 (RL) 使 LLM 能够通过在数据收集采样阶段和策略训练阶段之间交替来解决复杂任务。在轨迹采样过程中,代理会生成轨迹,即 LLM 和外部工具之间的多步骤交互。然而,频繁的工具调用会导致长尾轨迹生成,从而成为轨迹采样的瓶颈。这源于以步骤为中心的设计,忽略了轨迹上下文,引发了长尾轨迹生成的三个系统问题:排队延迟、干扰开销和每个词元时间膨胀。我们提出了 Heddle,一个以轨迹为中心的系统,用于优化Agent轨迹采样执行的时间、地点和方式。 Heddle 集成了三个核心机制:使用运行时预测的轨迹级调度和渐进优先级以最小化累积排队;通过预先排序的动态编程和空闲工具调用间隔期间的机会迁移进行轨迹感知放置,以最大限度地减少干扰;轨迹自适应资源管理器,动态调整模型并行性,以加快长尾轨迹的每个词元时间,同时保持短轨迹的高吞吐量。对不同代理 RL 工作负载的评估表明,Heddle 有效地消除了长尾瓶颈,与最先进的基准相比,端到端的采样吞吐量最高达到基线的2.5倍。