论文

保留探索能力的策略优化

Exploration-Preserving Policy Optimization

模型训练强化学习

摘要

具有可验证奖励的强化学习可以改善推理,同时分配学习信号形状,从而在重复采样下仍然可以访问解决方案。相对于群体的目标为同等奖励的响应分配同等的优势,使总信用与采样模式频率成正比。我们引入了探索保留策略优化 (ExPPO),这是一种轻量级的优势塑造规则,它使用提示相对、长度归一化响应 惊异度 和提示通过率来重新分配学分。 ExPPO 将有界整形与共享归一化相结合,以保留验证者极性并大致维持每个提示组的总绝对序列优势质量。我们的分析描述了响应级别的信用分配以及采样模式更新,得出了熵增益和正确模式发现的局部条件。实验表明,域内和域外推理覆盖率有所提高,聚合响应精度更高,并且在大采样预算下具有较强的覆盖率。受控的多答案评估进一步证明了正确模式产量的增加以及经过验证的正确答案之间多样性的增益。代码可在 https://github.com/jinhangzhan/ExPPO 获取