论文

DiPO:解开复杂性策略优化以实现细粒度探索-利用权衡

DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)促进了 大语言模型(LLM)推理能力的重大进步。然而,有效管理勘探和开采权衡仍然是一个严峻的挑战。在本文中,我们充分分析了极难样本和极易样本在训练过程中的探索和利用困境,并提出了一种新的细粒度权衡机制。具体来说,我们引入了一种困惑空间解缠策略,将样本空间划分为不同的探索(高困惑度)和利用(低困惑度)子空间,从而挖掘需要探索-利用权衡的细粒度样本。随后,我们提出了一种对验证奖励影响最小的双向奖励分配机制,以实现困惑引导的探索和利用,从而实现更稳定的策略优化。最后,我们在数学推理和函数调用这两个主流任务上评估了我们的方法,实验结果证明了所提出方法的优越性,证实了其通过细粒度探索-利用权衡来增强 LLM 性能的有效性。