论文

追溯优势校正:延迟感知 RLHF 的闭式 V 迹偏差校正

Retroactive Advantage Correction: Closed-Form V-Trace Bias Correction for Delay-Aware RLHF

模型训练强化学习

摘要

生产中根据人类反馈 (RLHF) 进行的强化学习并不总是具有同步奖励信号。代码执行验证器、缓慢的判断集成和排队的人工审核可以在产生它们的采样轨迹之后返回几个梯度步骤,打破了标准 PPO 背后的同步奖励假设。我们通过追溯优势校正(RAC)来解决这一差距:每个待处理的慢速完成都会排队,通过非负内核进行老化,并作为截断残差重新注入到下一个优化器步骤的优势中。我们证明,在无偏的截断重要性比下,当有效延迟核重新注入其所有质量时,累积 RAC 校正是完全无偏的,否则在未重新注入的部分中带有线性偏差;在无延迟身份内核中,它简化为 V-trace。在表格马尔可夫决策过程 (MDP) 概念验证中,RAC 在两个慢速通道配置中将封闭式策略偏差降低了 47.9 倍,以更低的挂钟成本击败了等待慢速。 RAC 通过两行奖励管理器补丁与 PPO 和 GRPO 集成。