论文

通过自适应张量并行加速同步RLHF训练中的长尾生成

Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism

模型推理分布式推理

摘要

基于人类反馈的强化学习(RLHF)已成为提升模型质量的关键后训练范式。然而,同步三阶段RLHF流程常受生成阶段瓶颈制约:响应长度的不均衡导致解码过程中有效批量大小迅速缩减,致使GPU利用率低下,而少数长响应仍未完成。主流框架采用静态张量并行(TP)配置,无法适应不断变化的批量特征,使大量性能提升空间未被挖掘。我们提出PAT,一种在每个RLHF迭代的生成阶段动态重配置TP的自适应TP方法。PAT引入了两项关键技术。其一,预测器引导的在线重配置方法基于离线剖析(profiling)来决定重配置点与目标TP配置,仅当预测的时延收益超过重配置开销时才触发重配置。其二,轻量级在线重配置机制只更新受TP变化影响的状态与布局:它通过基于代价模型在KV缓存迁移与重计算之间做出选择来适配未完成的解码状态,执行原地权重重切分,并复用缓存的通信组。我们在SGLang之上实现PAT,并将其与VeRL框架集成。在LLaMA3.1-8B和Qwen3-14B上使用DeepScaleR的评估表明,与原始VeRL配置相比,PAT将生成时延最多降低34.6%,将端到端RLHF训练迭代时延最多降低27.2%。

通过自适应张量并行加速同步RLHF训练中的长尾生成:论文配图
图2:迭代式RLHF训练的典型工作流示意,其中同步训练生成阶段的长尾延迟正是本文自适应张量并行方法所要加速的环节。