论文
弥合推理模型在信息不足下的检测-弃答鸿沟
Bridging the Detection-to-Abstention Gap in Reasoning Models under Insufficient Information
摘要
我们指出大推理模型在信息不足问题上的一种失效模式:模型可能识别出问题规定不充分,却仍继续推理并给出缺乏支撑的最终答案,而非弃答。我们将这种失配形式化为检测-弃答鸿沟:已检出的信息不充分未能转化为最终弃答。这一鸿沟在医疗AI等高风险领域尤为令人担忧,因为在证据不完整基础上给出的答案可能比拒答更有害。为弥合这一鸿沟,我们提出Judge-Then-Solve(JTS),一个轨迹级推理控制框架,训练模型在生成解答之前显式作出可答性承诺。JTS不是把弃答当作一种最终答案风格,而是将其视为一个控制决策:模型基于可答性判断要么继续求解,要么提前终止。我们通过监督热身与缺失前提强化学习(辅以一致性与长度塑形奖励)来实例化这一策略。在稠密与MoE推理模型上的实验表明,JTS在各数据集上大幅提升可靠弃答,并将Abstention@Detection(A@D)推向接近饱和,表明模型不仅能检出缺失信息,还能据此采取行动。通过在可答性判断之后立即终止不可答轨迹,JTS减少了不必要的推理,并在继续推机会放大无支撑假设的情况下提升推理效率。我们还观察到,缺失前提训练会改变模型在困难但可答问题上的推理行为,减少低效的自我反思。这些结果表明,信息不足下的弃答是安全高效部署推理模型的关键推理控制形式。
