论文

当自信误导时:主动标签获取用于强化学习并获得可验证的奖励

When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards

模型训练强化学习

摘要

大语言模型 (LLM) 在具有可验证奖励的强化学习 (RLVR) 的支持下,在推理能力方面取得了显着的进步。尽管如此,RLVR 本质上依赖于 真值 标签来进行奖励计算,在现实场景中,获取这些标签通常非常昂贵。虽然无监督 RLVR 范式试图通过伪标签训练来规避这一点,但众所周知,它们很容易出现训练崩溃的情况。此外,不同的样本通常表现出不同的注释值。在本文中,我们提出了带有主动可验证奖励的强化学习(RLAVR),它主动获取一小部分选定样本的 真值 标签并将其与伪标签集成,从而在有限的注释预算下稳定训练动态并提高性能。为了识别有价值的样本,我们提出了纠正优势差距(CAG)指标并分析样本级别的监督值。在此基础上,我们引入了 RLAVR 的校正感知可靠性估计 (CARE),它将 oracle CAG 标准转化为实用的预查询获取策略,以大幅提高训练稳定性。跨不同领域、模型系列和模型规模的广泛实验证明了我们方法的有效性和通用性。我们的代码可在 https://github.com/Lumina04/CARE 获取。