论文

GraphPO:基于图的推理模型策略优化

GraphPO: Graph-based Policy Optimization for Reasoning Models

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已成为增强大型推理模型能力的标准范例。 RLVR 通常独立对响应进行采样,并使用最终答案来优化策略。这种范式有两个局限性。首先,独立响应通常包含类似的中间推理步骤,导致冗余探索和浪费计算。其次,稀疏的最终答案奖励使得很难识别有用的步骤。基于树的方法通过共享前缀并比较来自相同前缀的分支以提供细粒度信号来部分解决此问题。然而,树枝仍然独立展开。当不同分支达到相似的推理状态时,它们无法共享信息并重复相似的探索。此外,基于树的方法忽略了这种分散性,并且仅在单独的分支内执行局部比较,这可能导致优势估计的方差更大。为了应对这一挑战,我们提出了 GraphPO(基于图的策略优化),这是一种新颖的 RL 框架,它将采样轨迹表示为有向无环图,将推理步骤作为边,将推理路径总结的语义状态作为节点。 GraphPO 将语义上等效的推理路径合并到等价类中,允许它们共享后缀并将预算从冗余扩展重新分配到多样化的探索。此外,我们将效率优势分配给输入边缘,将正确性优势分配给输出边缘,从而提高推理效率,同时从结果中获得过程监督。理论表明 GraphPO 减少了优势估计方差并提高了推理效率。在推理和代理搜索基准上对三个 LLM 进行的实验表明,在具有相同 词元预算 或响应预算的情况下,GraphPO 始终优于基于链和基于树的基线。