论文
HTPO:通过分层 词元级 目标控制实现探索-利用平衡策略优化
HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control
摘要
具有可验证奖励的强化学习(RLVR)已成为增强 大语言模型(LLM)推理能力的关键技术。然而,主流强化学习算法的实际做法是平等对待一个响应的所有标记,并为每个标记分配相同的优化目标,未能为推理过程提供细粒度的指导。在思想链(CoT)推理中,不同的标记通常扮演不同的角色。因此,当前的强化学习算法缺乏有效的机制来动态平衡学习过程中探索与利用的权衡。为此,我们提出了分层词元级目标控制策略优化(HTPO),这是一种新颖的强化学习算法,它采用分而治之的思想,从三个方面(即提示难度、答案正确性和词元熵)将响应词元分层划分为特定的功能组。在每个组内,根据对探索或利用的贡献,我们设计专门的优化目标,以促进每个词元预期功能的有效执行。通过这种方式,HTPO 可以实现更加平衡的探索-利用权衡。在具有挑战性的推理基准上进行的大量实验验证了我们的 HTPO 算法的优越性,该算法显着优于强大的 DAPO 基线(例如,在 AIME'24 和 AIME'25 上分别为 +8.6% 和 +6.7%)。在扩展测试时计算时,HTPO 训练的模型相对于 DAPO 基线保持一致的性能优势,并且随着采样预算的增加,差距扩大,验证了我们的自适应 词元级 控制方法可以在不牺牲开发性能的情况下促进有效的探索。代码位于 https://github.com/xcyao00/HTPO。