论文

暂停还是捏造?训练有根据的推理语言模型

Pause or Fabricate? Training Language Models for Grounded Reasoning

模型训练强化学习

摘要

大语言模型在复杂推理任务上取得了显着的进步。然而,当输入不完整时,它们常常隐含地捏造信息,产生自信但不可靠的结论——我们称之为无根据推理的失败模式。我们认为,这个问题不是由于推理能力不足引起的,而是由于缺乏推理边界意识——即识别何时缺少有效推理的必要前提的能力。为了解决这个问题,我们提出了基于交互式强化学习的扎根推理(GRIL),这是一种在不完整信息下进行扎根推理的多轮强化学习框架。 GRIL 将推理过程分解为两个阶段:澄清和暂停,确定可用信息是否充足;扎根推理,一旦建立了必要的前提,就执行任务解决。我们设计了特定阶段的奖励来惩罚幻觉,使模型能够发现差距、主动停止并在澄清后恢复推理。 GSM8K-Insufficient 和 MetaMATH-Insufficient 上的实验表明,GRIL 显着改进了前提检测(高达 45%),使任务成功率提高了 30%,同时将平均响应长度缩短了 20% 以上。其他分析证实了对嘈杂用户响应的稳健性以及对分布外任务的泛化。