论文

SARL:通过奖励推理拓扑实现无标签强化学习

SARL: Label-Free Reinforcement Learning by Rewarding Reasoning Topology

模型训练强化学习RLVR

摘要

强化学习已成为改进大推理模型的核心,但其成功仍然在很大程度上依赖于可验证的奖励或标记的监督。这限制了其对正确性不明确且无法验证的开放式领域的适用性。此外,推理轨迹在很大程度上仍然不受约束,并且对最终答案的优化可以有利于早期利用而不是泛化。在这项工作中,我们询问是否可以通过教授模型如何思考(推理的结构)而不是产生什么(推理的结果)来提高一般推理能力,并将传统的 RLVR 扩展到开放式环境。我们引入结构感知强化学习(SARL),这是一种无标签框架,受复杂网络和人脑功能组织的启发,它从中间思维步骤构建每个响应推理图并奖励其小世界拓扑。 SARL 鼓励本地一致且全球高效的推理轨迹,将监督从目的地转移到路径。我们在 Qwen3-4B 上的实验表明,SARL 超越了基于真实事实的 RL 和先前的无标签 RL 基线,在数学任务上在 PPO 下实现了 9.1% 的最佳平均增益,在 GRPO 下实现了 11.6% 的最佳平均增益,在开放式任务上在 PPO 下实现了 34.6%,在 GRPO 下实现了 30.4%。除了良好的性能之外,SARL 还表现出较低的 KL 散度、较高的策略熵,表明其具有更稳定的探索性训练和广义推理能力。

SARL:通过奖励推理拓扑实现无标签强化学习:论文配图
图 1:结构感知强化学习 (SARL) 概述。左:SARL 用根据模型推理过程计算的无标签结构奖励取代了基于结果的监督。中:奖励是由小世界先验驱动的,它平衡了局部专业化和全球一体化。右:SARL 推理图和结构奖励的构建。