论文
CRiT-QA:以反事实链与干扰陷阱评估多跳推理
CRiT-QA: Evaluating Multi-hop Reasoning with Counterfactual Chains and Distractor Traps
摘要
评估大语言模型的多跳推理能力仍是重大挑战。尽管当前模型在既有多跳问答数据集上成绩强劲,这种表现常掩盖两个关键脆弱性:(1) 依赖内部参数知识而非遵循给定上下文;(2) 利用数据集捷径——如单文档线索或类型匹配——削弱跨文档真实证据聚合的需要。我们提出CRiT-QA(带陷阱的反事实推理):一个明确针对这两个局限的数据集。为中和记忆知识的依赖并强制严格上下文依赖,CRiT-QA用反事实实体变换事实推理链;并注入多锚干扰链——在不同跳数处分叉的貌似合理却错误的推理路径。这些陷阱要求模型遵循整个推理过程而非利用浅层启发式。实验显示LLM在CRiT-QA上较标准数据集大幅退化——暴露其对反事实条件与干扰陷阱的脆弱性。CRiT-QA因此可作为评估真实多跳推理的严格诊断工具,为开发更可靠、以证据为本的LLM奠定基础。
