论文

量化多查询LLM推理中的跨查询矛盾

Quantifying Cross-Query Contradictions in Multi-Query LLM Reasoning

模型评测基准与评测资源

摘要

大语言模型在对多个相关查询进行推理时,经常产生相互矛盾的答案。我们研究案卷级逻辑一致性:在相互依赖的查询之间维持全局可满足的信念状态。我们构建了一个包含390个多查询推理实例、标注蕴含/矛盾/未知标签的基准,并提出案例可满足率(Case Satisfiability Rate)、矛盾密度(Contradiction Density)和修订成本(Revision Cost)等集合级指标。我们的求解器增强方法提取承诺、验证全局可满足性,并执行反例引导的修复。在四个推理领域上,我们的方法大幅减少跨查询矛盾(SetCons从0.56提升至0.94),同时保持单查询准确率,表明全局一致性对稳健的多查询推理至关重要。