论文
缓解多指令遵循强化学习中的探索偏差
Mitigating Exploration Bias in RL for Multi-Instruction Following
摘要
强化学习已成为增强 LLM 指令遵循能力的强大范例。虽然现有的训练方法取得了显着的成果,但我们发现,当训练数据在提示中包含多个指令时,它们会出现对简单指令的探索偏差。这种偏差主要由两个原因造成:1)策略模型满足困难指令的初始能力太低,无法在强化学习训练期间触发成功的探索,因此优化偏向于简单指令; 2)规范的强化学习训练方案通常采用累积奖励(完成的指令数量),平等对待所有指令,这使得策略模型偏向于完成简单的指令以获得相同数量的奖励。为了解决这些问题,我们首先提出两个指标来衡量指令遵循中的探索偏差,然后引入一个两阶段框架来缓解它:1)行为引导,RL 之前的轻量级拒绝采样 微调 阶段,用于激活困难指令; 2)稀缺感知奖励,一种新的强化学习奖励函数,根据经验稀缺性为指令分配奖励。实验表明,所提出的指标与模型性能高度相关,并且我们的方法释放了 RL 训练的潜力:我们的最佳模型在三个可验证的指令遵循基准中明显优于基线。我们在 https://github.com/mianzhang/MulIF 发布代码。