论文

StepGap:识别多跳问答推理步骤的证据缺口

StepGap: A Hybrid NLI-LLM Checker for Step-Level Evidence-Gap Detectionin Multi-Hop Question Answering

模型训练奖励建模与过程监督

摘要

研究提出 StepGap,以混合自然语言推断与大语言模型的决策树识别多跳问答中的逐步证据缺口,并输出三类标签:陈述与证据矛盾(CC)、证据无关(IE)、缺少推理桥梁(MB);每类标签对应具体的修复动作。在82个多跳问题、181个标注步骤上,标注一致性 κ 为0.704,StepGap 的步骤级 F1 为72.0,位于纯大语言模型基线(70.1)的自助采样置信区间内。StepGap 的结构更容易拆解分析:删除任一阶段都会降低 F1,而纯大语言模型方案的四次阶段删除中有三次反而提高 F1,说明该方案可能存在内部阶段相互掩盖错误的现象。研究还发现问题级 F1 的陷阱:将每个步骤都标为有问题,会机械地抬高问题级 F1,因此需要用步骤级 F1 诊断。将 StepGap 用作按错误类型区分的 GRPO 过程奖励后,三个随机种子的实验将 Qwen2.5-7B-Instruct 的精确匹配率从32.1±0.3提高到35.4±0.9;另一次单次运行比较中,平均精确匹配率比同条件复现的 Search-R1 GRPO 高5.6个百分点。