论文

REIN:以反思与弃答对齐弥合推理与可靠性之间的鸿沟

REIN: Bridging the Gap between Reasoning and Reliability via Reflection and Abstention Alignment

模型训练强化学习

摘要

大型推理模型(LRM)容易产生幻觉,这削弱了其可靠性并给安全部署带来挑战。LRM中的幻觉源于两种不同的失败来源:推理幻觉,即有缺陷的推理步骤传播导致错误结论;以及知识幻觉,即模型缺乏回答查询所需的事实知识。为解决推理幻觉,我们提出REIN,一个对齐框架,训练LRM产生结构化推理序列<think>→<reflection>→<answer>,在给出最终答案之前进行显式自我反思。为解决知识幻觉,REIN引入奖励机制,当所有采样的推理链都无法得出正确答案时,鼓励模型显式弃答(例如"我不知道"),使模型避免作出无依据的预测。在数学与常识推理基准上的广泛评估表明,与有竞争力的基线相比,REIN持续提升选择性准确率,减少错误却自我确信的回答,并保持高覆盖率。值得注意的是,REIN在单次前向传播内实现这些增益,无需过程监督、推理时控制器、外部搜索或多轮批评。在多个骨干模型上的实验表明,REIN将幻觉代理指标相对基座模型降低58~72%,同时保持86~91%的平均覆盖率,并将已作答问题的选择性准确率提升6.6~14.2%。

REIN:以反思与弃答对齐弥合推理与可靠性之间的鸿沟:论文配图
图1:REIN训练流水线概览:反思增强的补全送入GRPO,并使用反思奖励和边界感知弃权奖励。