论文
REALHOP:通过行为审计重新思考多跳推理评估
REALHOP: Rethinking Multi-Hop Reasoning Evaluation via Behavioral Auditing
摘要
复杂的问题通常需要多跳推理,通过中间步骤将分布在长上下文的源或遥远区域的事实连接起来。基准通常通过围绕预定义推理链构建的问题来评估这种能力,将正确答案视为使用了预期组合的证据。然而,仅答案正确性就无法确定成功是否取决于与每个预期步骤相关的证据:模型可能依赖于记忆的关联、较短的路径或部分证据。我们使用行为必要率(BNR)来检查这种依赖性,它衡量有针对性的证据删除阻止最初正确实例的答案恢复的频率。在五个现有基准中,面板平均 BNR 范围从 16.6% 到 48.9%,暴露了注释结构和观察到的依赖性之间的巨大差距。在此诊断的指导下,我们引入了 REALHOP,这是一个诊断-构建-验证框架,可以重新绑定实体、分解选定的关系、添加完整的竞争路径并将证据放置在可追踪的位置。冻结之前进行结构和语义检查;随后进行行为干预。在 790 个配对的 MuSiQue 问题上,REALHOP 将小组平均 BNR 从 27.4% 提高到 94.4%,同时保持较高的完全准确率。它还在 REALHOP-FRAMES 和 REALHOP-LONGBENCH 上产生高 BNR。在 216 个长上下文问题上,16 个模型中匹配的多项选择分布从 13.9 分增长到 59.2 分,并且在重复的开放式评估中保持不变。总之,这些结果表明,概念上连贯的链和正确的最终答案本身并不能建立多跳推理。因此,验证成功取决于每个预期的跳跃对于多跳评估来说与测量答案准确性本身一样重要。