论文

DynaResize:面向分离式 LLM 后训练的运行时 GPU 重分配

DynaResize: Runtime GPU Reallocation for Disaggregated LLM Post-Training

AI 基础设施分布式训练基础设施

摘要

基于 RL 的 LLM 后训练日益将 Rollout 与 Training 分离到不同的 GPU 资源上,但静态 GPU 划分在长尾 rollout 延迟下会出现严重的流水线气泡。我们提出 DynaResize,一个运行时 GPU 重分配系统,在 Rollout 与 Training 之间动态切换 GPU 以平衡各阶段执行时间,且不改变 RL 语义。DynaResize 将重尺寸操作分解为细粒度操作,并通过通信器复用、有界状态暂存和基于迟滞的重尺寸,将非启动关键工作移出关键路径。实验结果表明,与最优静态配置相比,DynaResize 可将端到端吞吐提升 66.5%,总执行时间缩短 33%,同时隐藏 27% 的角色切换开销。

DynaResize:面向分离式 LLM 后训练的运行时 GPU 重分配:论文配图
图 1. 缓解异步训练-推出不平衡的方法比较一步关闭策略及其 3 种算法解决方案的比较以及我们的工作