论文

对比分支策略优化

Contrastive Branch Policy Optimization

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)使语言模型能够学习与外部工具的多轮交互,但其稀疏的结果奖励无法提供任何信号来识别哪些中间决策对成功负责。分支抽样会引起替代延续之间的局部比较,但现有方法往往会混淆两个不同的问题:分配固定的采样轨迹预算和将分支结果转换为 词元级 信用。我们引入了对比分支策略优化(CBPO),它解决了这两个问题,并为每个问题分配了专用机制。生成熵在整个响应中筛选候选分支位置,而路径级和节点级衰减在轨迹和位置之间分配固定预算,以防止探索崩溃到几个路径或相邻标记上。父轨迹与共享相同词元前缀的分支一起形成一个精确前缀组,并且该控制组内的奖励变化定义了对比分支值(CBV),这是一种基于结果的局部决策敏感性估计,可在不改变其符号的情况下重新调整连续优势。当沿同一轨迹选择多个节点时,CBPO 将其划分为不重叠的信用段,从而避免共享词元上的重复梯度。 CBPO 仅需要结果奖励,不需要过程级注释,为工具集成代理训练中的细粒度信用分配提供了实用的解决方案。对十个基准(包括五个数学推理和五个知识密集型搜索)的广泛实验表明,CBPO 始终优于最先进的策略优化和基于分支的方法,在两个领域和两个模型尺度上获得了最高的宏观平均准确度。