论文
DynaResize:面向分离式 LLM 后训练的运行时 GPU 重分配
DynaResize: Runtime GPU Reallocation for Disaggregated LLM Post-Training
摘要
基于 RL 的 LLM 后训练日益将 Rollout 与 Training 分离到不同的 GPU 资源上,但静态 GPU 划分在长尾 rollout 延迟下会出现严重的流水线气泡。我们提出 DynaResize,一个运行时 GPU 重分配系统,在 Rollout 与 Training 之间动态切换 GPU 以平衡各阶段执行时间,且不改变 RL 语义。DynaResize 将重尺寸操作分解为细粒度操作,并通过通信器复用、有界状态暂存和基于迟滞的重尺寸,将非启动关键工作移出关键路径。实验结果表明,与最优静态配置相比,DynaResize 可将端到端吞吐提升 66.5%,总执行时间缩短 33%,同时隐藏 27% 的角色切换开销。
