论文
REFACT:用于紧凑和忠实的思想链推理的自适应事实重述
REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning
摘要
大语言模型 (LLM) 越来越多地利用长形式推理来解决复杂任务,但当证据不完整、有噪音或与参数知识冲突时,它们的推理过程可能会偏离所提供的上下文。现有的证据对齐方法要么在生成后附加引文,要么鼓励 LLM 在推理过程中检索证据,但它们往往无法确保引用的信息足以支持中间推论和最终答案。为了解决这一限制,我们提出了 REFACT,这是一种自适应事实重述引用框架,使 LLM 能够确定何时需要上下文基础,并以适当的详细程度有选择地重述源事实,以进行可靠的推理。为了促进推理过程中的自适应引用,REFACT 首先利用教师 LLM 在具有不同证据长度的不同上下文条件下构建高质量的引用感知推理轨迹,然后通过两阶段 SFT-to-RL 框架优化学生 LLM。 LongBench、LV-Eval 和 ConFiQA 上的实验表明,REFACT 改进了长上下文问答和反事实 忠实性,同时大幅减少了推理标记的数量。进一步的分析表明,REFACT 通过保留更多与答案相关的事实和更少的重述来实现更高的证据密度,产生更简洁但更有根据的推理痕迹。所有代码和数据将通过https://github.com/NEUIR/REFACT发布。