论文

LatentRevise:从零命中推理中学习

LatentRevise: Learning from Zero-Hit Reasoning

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)受到硬提示的瓶颈,硬提示的正确轨迹概率很低,因此采样在实际预算内错过了它们,并且使策略更新几乎没有有用的信号。我们将这种零命中提示视为 RLVR 的采样前沿,其中新的推理行为最有价值,但被采样的可能性最小。重要的是,失败的采样轨迹可以提供信息:它们暴露了模型推理的错误所在。我们引入 LatentRevise,这是一种一阶潜在修正方法,可以恢复这种零命中状态的训练信号。给定失败的采样轨迹和标准答案作为锚点,LatentRevise 在两个互补梯度下优化其推理前缀的输入嵌入,将前缀从失败的延续移向标准答案。优化仅限于模型词汇嵌入的凸包,因此每次更新都会将潜在变量移向真实的标记嵌入,而不是任意特征方向。我们发现修订后的前缀的延续延长了,表现出自我反思,并达到了原始采样轨迹所错过的正确答案。这些轨迹用作训练数据,在数学基准上比标准基线提高了 SFT 和 RLVR。