论文

RLHFless:用无服务器计算实现高效 RLHF

RLHFless: Serverless Computing for Efficient RLHF

AI 基础设施AI 开发与运维平台

摘要

基于人类反馈的强化学习(RLHF)已广泛应用于大语言模型(LLM)后训练,使模型输出与人类偏好对齐。近期模型(如 DeepSeek-R1)也展示了 RLHF 改进 LLM 复杂任务推理的潜力。在 RL 中,推理与训练并存,在整个工作流中产生动态的资源需求。与传统 RL 相比,RLHF 因模型规模与资源消耗扩大而进一步挑战训练效率。多个 RLHF 框架力求平衡灵活抽象与高效执行,但它们依赖服务器式(serverful)基础设施,难以应对细粒度的资源可变性。因此,在同步 RLHF 训练中,RL 组件之间或内部的空闲时间常造成开销与资源浪费。针对这些问题,我们提出 RLHFless,首个构建于无服务器计算环境上的可扩展同步 RLHF 训练框架。RLHFless 适应 RLHF 流水线全程的动态资源需求,预计算共享前缀以避免重复计算,并使用考虑响应长度变化的成本感知 actor 扩缩策略,以更低成本与更高速度找到最优平衡点。此外,RLHFless 高效分配工作负载,减少函数内不均衡与空闲时间。在物理测试床与大规模模拟集群上的实验表明,RLHFless 相比最先进基线实现最高 1.35 倍加速与 44.8% 成本降低。

RLHFless:用无服务器计算实现高效 RLHF
图5: RLHFless 概览。