论文
解释和防止迭代 RLHF 中的对齐崩溃
Explaining and Preventing Alignment Collapse in Iterative RLHF
摘要
基于人类反馈的强化学习 (RLHF) 通常假设静态或非策略奖励模型 (RM)。然而,在迭代部署中,策略生成用于重新训练 RM 的数据,从而创建反馈循环。基于此交互的 Stackelberg 博弈公式,我们将策略的真实优化梯度分析分解为标准策略梯度和参数引导项,以捕获策略对 RM 未来参数的影响。我们表明,标准迭代 RLHF 完全放弃了这个转向项,会遭受对齐崩溃的困扰:该策略系统地利用 RM 的盲点,产生低质量、高回报的输出,其反馈强化了它所利用的错误。为了缓解这个问题,我们提出了预见性策略优化(FPO),这是一种机制设计干预,通过规范策略对 RM 更新的参数控制效果来恢复缺失的控制项。我们通过可扩展的一阶近似实例化 FPO,并证明它可以防止受控环境和使用 Llama-3.2-1B 的 LLM 对齐管道上的对齐崩溃。