论文
推理还是制造:通过提示锚定成对聚合进行无捷径的推理
To Reason or to Fabricate: Reasoning Without Shortcuts via Hint-Anchored Pairwise Aggregation
摘要
虽然强化学习 (RL) 显着增强了 LLM 推理,但其功效因 Pre-RL 数据重叠而严重削弱,其中 RL 数据集与预训练或 SFT 语料库重叠,导致模型通过记住正确答案和构建事后推理来利用捷径。为了解决这个问题,我们引入了 HIPPO,这是一种新颖的 RL 框架,它将提示注入聚合与定制的成对奖励模型集成在一起。通过利用提示注入故意触发重叠引起的行为,产生的痕迹自然地充当成对比较的显式锚点。这提供了高度可区分的偏好信号,使轻量级判断模型能够可靠地区分真正的推理演绎和捷径驱动的合理化,而成对公式确保了与标准 PRM 相比稳定和鲁棒的优化。大量的实验表明,HIPPO 比标准基线有了显着的改进,并有效地推广到分布外的一般任务,表明它提取了真实的、可转移的推理技能,而不是肤浅的捷径模式。