论文

证据推理重建:当证据被召回但推理出错时

Evidence-Inference Reconstruction: When The Evidence Is Recalled But The Reasoning Goes Wrong

上下文与知识检索增强

摘要

现代多跳 LLM Agent配备了内置机制来检测中间推理步骤中的错误。此类错误会触发这些Agent的纠正措施,这些措施大多遵循重试步骤或推理轨迹的范式。这些重试不仅成本高昂,而且我们在本文中指出它们也可能是不必要的。为此,我们引入了证据推理重建(EIR),它使用结构化状态来指导一个检索轨迹,在此过程中积累源证据。我们表明,只要收集了相关证据,即使由于不正确的中间推理步骤而混合了错误的证据,EIR 也能够在单个最终模型调用中生成正确的答案。在一项评估中,我们使用 Haiku 4.5 和 GPT-4.1 Mini,在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 的 1,000 个匹配问题子集上评估 EIR,结果表明 EIR 将答案 F1(模型与正确答案之间的重叠)比基线提高了 8.3--32.8 分,将 Agentic SSR 提高了 10.6--29.1点,反射点 1.1--15.9 点。此外,我们还发现,EIR 每个问题的平均模型调用总数为 4.85 次,而 Agentic SSR 的模型调用总数为 35.29 次,Reflexion 的模型调用总数为 12.41 次。总之,这些结果证实了 EIR 的中心前提:将证据检索与最终答案模型调用分开可以提高答案准确性,同时大大减少计算量。