论文
用于扩大 RLVR 推理覆盖范围的难度自适应树结构策略优化
Difficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVR
摘要
带有可验证奖励的强化学习(RLVR)是大型推理模型最近取得成功的核心。然而,虽然 RLVR 显着提高了单样本精度,但由于训练过程中的探索有限,它往往无法扩展模型的内在推理覆盖范围(pass@k)。为了解决这个问题,我们优化了训练时轨迹采样的结构设计以增强 pass@k。我们的分析确定了三个关键设计原则:(1)难度自适应轨迹采样除了作为一种效率启发式方法外,还可以在扩展 pass@k 方面发挥重要作用; (2) 基于树的轨迹采样在发现正确答案方面优于并行采样; (3)句子熵引导的分叉克服了词元级分支的本地化现象,以最大化语义多样性。基于这些见解,我们提出了 DATPO(难度自适应句子熵引导树结构策略优化)。 DATPO 将难度自适应树搜索与兄弟多样性优势项相结合,明确促进语义多样性以扩大训练期间的推理覆盖范围。数学推理基准实验表明,DATPO 的性能优于基线,尤其是在 pass@k 方面,这直接转化为卓越的测试时间扩展性能。