论文

弥合推理模型在信息不足下的检测-弃答鸿沟

Bridging the Detection-to-Abstention Gap in Reasoning Models under Insufficient Information

模型训练强化学习

摘要

我们指出大推理模型在信息不足问题上的一种失效模式:模型可能识别出问题规定不充分,却仍继续推理并给出缺乏支撑的最终答案,而非弃答。我们将这种失配形式化为检测-弃答鸿沟:已检出的信息不充分未能转化为最终弃答。这一鸿沟在医疗AI等高风险领域尤为令人担忧,因为在证据不完整基础上给出的答案可能比拒答更有害。为弥合这一鸿沟,我们提出Judge-Then-Solve(JTS),一个轨迹级推理控制框架,训练模型在生成解答之前显式作出可答性承诺。JTS不是把弃答当作一种最终答案风格,而是将其视为一个控制决策:模型基于可答性判断要么继续求解,要么提前终止。我们通过监督热身与缺失前提强化学习(辅以一致性与长度塑形奖励)来实例化这一策略。在稠密与MoE推理模型上的实验表明,JTS在各数据集上大幅提升可靠弃答,并将Abstention@Detection(A@D)推向接近饱和,表明模型不仅能检出缺失信息,还能据此采取行动。通过在可答性判断之后立即终止不可答轨迹,JTS减少了不必要的推理,并在继续推机会放大无支撑假设的情况下提升推理效率。我们还观察到,缺失前提训练会改变模型在困难但可答问题上的推理行为,减少低效的自我反思。这些结果表明,信息不足下的弃答是安全高效部署推理模型的关键推理控制形式。

弥合推理模型在信息不足下的检测-弃答鸿沟:论文配图
图 1:检测到弃权差距和判断然后解决 (JTS) 的概述。 (A) 基础或普通强化学习模型可能会识别出缺少关键前提,但仍会通过做出不受支持的假设并输出捏造的答案来继续推理,从而说明检测到弃权的差距。 (B) JTS 在求解之前明确判断可回答性;一旦问题被认为无法回答,则提前终止推理并弃权。 (C) 对缺失前提数据进行训练,尤其是具有长度整形的 JTS,将行为从无支持的回答转变为可靠的弃权,并减少“检测到但未弃权”的故障模式。