论文
融合 Gromov-Wasserstein 几何上 RLVR 的分层信用分配
Hierarchical Credit Assignment for RLVR on Fused Gromov-Wasserstein Geometry
摘要
具有可验证奖励的强化学习(RLVR)已被证明可以提高大语言模型(LLM)在不同推理任务中的推理能力。然而,基于组的 RLVR 方法(例如 GRPO)为相同结果的执行轨迹内的所有token分配统一的优势。虽然现有的工作基于局部信号(例如token位置或熵)细化 GRPO 的信用分配,但它们通常无法捕获相对于当前策略的推理行为的全局语义新颖性。在这项工作中,我们提出了一种基于组的 RLVR 方法的分层信用分配方法,称为 HarA,它识别并鼓励 RLVR 期间语义新颖的推理行为。 HarA 将每个采样的执行轨迹表示为token隐藏状态和位置的分布,并计算具有相同结果的所有执行轨迹的融合 Gromov-Wasserstein (FGW) 重心,捕获当前策略下潜空间中的内部推理模式。然后,推理元素的语义新颖性可以通过其对当前执行轨迹和重心之间的 FGW 距离的贡献来测量。虽然求解 FGW 公式的成本很高,但我们引入了锚引导线性化,将其转换为可通过 Sinkhorn 算法有效求解的 Wasserstein 公式。通过重新权衡基于新颖信号的基于组的 RLVR 方法的token级优势,HarA 突出了灵活粒度的新颖推理行为,以鼓励细粒度的LLM探索。三种基于组的 RLVR 方法的广泛实验表明,我们的即插即用方法有效地增强了LLM的探索,在不同的推理基准上优于现有方法。
