论文
询问、条件或弃权:针对缺失前提推理的强化学习
Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning
摘要
仅答案强化学习 (RL) 训练推理模型来解决完全指定的问题,但许多实际查询忽略了唯一答案所需的前提。在这种情况下,有用的响应并不总是拒绝:模型应该询问缺失的前提,根据未知数量确定答案,或者在没有信息性条件响应可用时放弃。我们提出了 \emph{Ask-Condition-Abstain 强化学习} (ACA-RL),这是一种针对此设置的数据增强 RL 框架。其推理图引导管道将适定问题转换为具有局部间隙注释的缺失前提训练实例;然后,ACA-RL 对这些实例进行训练,并针对五种可观察的响应行为提供结构化奖励。我们还引入了 \emph{Missing-Premise Benchmark} (MPB),这是一个经过 274 个实例人类验证的基准,涵盖数学、逻辑和现实世界的文字问题。在 Qwen3 和 Llama 模型中,ACA-RL 持续改进 MPB,同时保持在适定推理任务上的竞争性能。与已发布的代码、MPB 和训练数据一起,这项工作支持了 NLP 评估的新使命:衡量模型是否能够识别任务不确定性并处理不确定性,而不仅仅是它们是否能够回答完全指定的问题。