论文

MInTRL:用最小离策略干预改善同策略强化学习

MInTRL: Off-policy Intervention can boost On-policy RL

模型训练强化学习

摘要

可验证奖励强化学习通常采用同策略训练,使训练数据接近当前策略,但只能学习策略自身能够发现的轨迹。监督微调等离策略方法能够利用超出基础模型能力的外部知识,却可能遭遇较大的分布偏移。关键问题是如何扩展探索而不损害可学习性。本文提出最小干预强化学习(MInTRL),在原本由当前策略生成的轨迹中加入稀疏局部干预,扩展探索范围。生成时,评判与干预策略定期检查当前输出,用短纠正替换错误后缀,然后立即把控制权交还当前策略。训练时采用序列级优势回归目标,无需重要性采样。稀疏局部干预在保留轨迹整体同策略特性的同时,提高了有限预算下同策略采样所能覆盖的范围。在数学和代码基准上,MInTRL持续优于标准同策略与离策略基线。消融实验表明,自我干预及不同评判策略下仍然有效;表现则在适度干预时达到最高,说明最小干预的重要性。这些结果支持以最小干预增强同策略强化学习。