论文
CATPO:批评增强树策略优化
CATPO: Critique-Augmented Tree Policy Optimization
摘要
具有可验证奖励的强化学习(RLVR)已成为提高 大语言模型(LLM)推理能力的主导范式。最近的基于树的方法(例如 TreeRPO)通过树结构的执行轨迹扩展了平坦轨迹采样,以获得密集的步骤级奖励信号,而无需单独的过程奖励模型。然而,并非所有树都具有同等的信息量:所有叶子都成功的树,所有叶子都失败的树,或者策略已经预测奖励分布对梯度更新贡献很小的树,浪费计算。我们引入了 CATPO(批判增强树策略优化),它可以在树级别诊断并解决这种浪费。 CATPO 首先通过树信息量分数 F(T) 对每棵树进行评分,在零额外计算的情况下将叶结果多样性与策略奖励去相关相结合。对于所有分支都失败的大错特错的树,CATPO 采用批评引导修复:它找到最浅的失败点,生成自然语言批评,并嫁接精致的延续以恢复训练信号。最后,信息量加权损失通过其归一化分数来缩放每棵树的梯度贡献,将参数更新集中在信息量最大的树上,同时保留整体梯度大小。使用 MATH 数据集训练的 Qwen2.5-Math-1.5B 实验表明,CATPO 在四个基准测试(AIME24、MATH-500、OlympiadBench 和 MinervaMath)上实现了 37.5% 的宏观准确率,比 TreeRPO 提高了 1.9%,比 GRPO 提高了 4.8%。