论文

TailSieve:部分Rollout引导的LLM Rollout尾部路由

TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts

AI 基础设施推理服务

摘要

大规模rollout已成为现代LLM系统的核心组件,涵盖强化学习(RL)后训练、在线策略蒸馏(OPD)以及重采样的评估流水线。与通常按请求级延迟和吞吐优化的在线服务不同,少量长尾生成即可主导整个rollout步骤的端到端完成时间(makespan)。实践中,rollout请求常被均匀路由到各副本,这可能把极长的生成放进高并发解码批次中。为此,我们提出TailSieve,一个联合控制LLM rollout尾部路由与副本分配的部分rollout引导框架。在完成长度已知的理想化设定下,我们证明长尾状态下的makespan最优路由是尾部隔离与负载均衡的结合,且简单的top-k策略就能很好地逼近该离线最优。利用长尾提示在策略更新之间倾向于保持长尾的观察,TailSieve用部分rollout作为免训练信号来识别候选尾部组。一个分层控制器随后基于收集的响应工作量历史和一个实测的并发-吞吐模型,联合调整隔离组数量以及尾部池与主体池之间的副本切分。TailSieve相比均匀组路由取得至多1.67倍的纯路由加速。由此形成的低并发尾部池还进一步支持使用MTP或DFlash的路由专用投机解码,相比均匀路由取得至多2.59倍加速。被选中的提示会在当前策略下重新生成,从而保持在线策略生成,并在稳态下避免路由引入的额外长度偏差。

TailSieve:部分Rollout引导的LLM Rollout尾部路由:论文配图
图5:TailSieve 工作流:预热阶段尾部识别、双池联合执行与分层控制。