论文

Rollplex:视觉语言模型的跨相 GPU 空间共享 后训练

Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training

AI 基础设施分布式训练基础设施

摘要

视觉语言模型(VLM)使实体代理能够根据视觉观察和语言指令进行推理和行动。强化学习 (RL) 后训练 使用任务反馈增强这些功能,但当前的 同策略 RL 运行时在严格的串行阶段执行轨迹采样、参考评分和策略模型训练。虽然对于纯文本 RL 有效,但这种阶段粒度执行对于 VLM 来说是一种浪费,因为在 VLM 中处理密集的视频输入和提示前缀占据了每个阶段的很大一部分。由于前缀处理独立于生成的响应,因此它可以与转出解码一起运行,从而使 GPU 计算能力未得到充分利用,而不会破坏同步 同策略 语义。我们提出了 Rollplex,一个分解参考和训练阶段并将前缀计算移动到 rollout 解码窗口的运行时。实现这个时间表需要的不仅仅是并发内核启动:Qwen2.5-VL-32\,B 的简单托管需要每个 GPU 大约 165\,GiB,而轨迹采样和训练更喜欢不同的张量并行 (TP) 程度和权重布局。 Rollplex 通过两种机制解决这些限制。阶段感知内存管理根据生产者-消费者生命周期控制 HBM 驻留。并行感知权重共享对不同 TP 度上的布局兼容张量使用相同的物理存储,并且仅重建不兼容的张量,从而避免了完整的第二个 actor 副本。在 32 个 H800 GPU 上,Rollplex 在相同 GPU 预算下比串行托管实现了 $1.23\times$--$1.30\times$ 加速,比分解实现了 $1.57\times$--$2.24\times$ 加速,同时保留了同步 RL 更新。