论文
策略改进强化学习:直接核验训练更新是否有效
Policy Improvement Reinforcement Learning
摘要
强化学习已成为改善大模型和Agent能力的主要后训练范式,但既有方法常从采样轨迹、奖励或反馈条件目标构建局部学习信号,更新策略后却不显式核验它是否优于上一版本。局部目标改善不一定带来更好的策略,有限采样、随机生成和反馈噪声还可能扩大这一差距。本文提出策略改进反馈,用于衡量跨迭代进展,并建立策略改进强化学习PIRL,将迭代间的任务表现增益作为与最终性能对齐的目标。在此基础上,PIPO构建即插即用的闭环框架,针对滑动窗口历史性能锚点核验上一次更新,用反馈强化带来实测进步的更新、抑制表现下降的更新。理论分析显示PIPO可在局部使策略更新与PIRL目标一致。数学推理、代码、工具使用和自蒸馏实验中,在PPO、组相对及自蒸馏策略优化家族上均取得稳定提升。