论文

局部合理,全局不足:多跳推理中的局部与全局差距

Locally Sound, Globally Insufficient: The Local-Global Gap in Multi-Hop Reasoning

模型训练监督微调与指令调优

摘要

可靠的多跳推理需要的不仅仅是本地支持的步骤:每个推理步骤的跟踪都可能是合理的,但仍然无法回答整个问题。我们将这种失效机制称为局部全局差距(LGG),其中轨迹局部良好但全局不足。局部健全性要求每个步骤都有可用证据和先前步骤的支持,而全局充分性要求推理轨迹与问题保持一致并建立提交的答案。在对三个多跳 QA 基准和三个模型的 2,598 个响应进行人工裁决的诊断中,我们发现 LGG 出现在每个基准-模型组合中,并且占全球总体不足响应的近一半。然而,根据证据检查声明的传统忠实性验证者很大程度上会忽略这些失败:在保留至少 95% 可靠痕迹的阈值下,LGG 案例的召回率大大低于局部不健全痕迹的召回率。为了解决这些失败,我们形式化了可靠推理的三个依赖关系:证据到步骤的支持、问题到跟踪的对齐以及跟踪到答案的闭包。我们引入电子闭包来在训练期间监督这些依赖性,而不是事后诊断,将对支持的原始和反事实响应的生成监督与双向切换约束相结合。对三个基准和三个骨干网进行平均,现有的微调基线比基本模型提高了准确性和局部鲁棒性,但代价是全局充足性。 E-Closure 改进了这两个方面:在所有微调方法中,它实现了最高的平均准确度 (92.8%) 和迹线可靠性 (89.0%),同时产生最低的 LGG 率 (6.2%)。