论文

探索忠实 LLM 推理的知识冲突:基准和方法

Exploring Knowledge Conflicts for Faithful LLM Reasoning: Benchmark and Method

模型评测基准与评测资源

摘要

大语言模型 (LLM) 在广泛的应用中取得了显着的成功,特别是在通过检索增强生成 (RAG) 通过外部知识进行增强时。尽管它们被广泛采用,但最近的研究表明,LLM 在检索到冲突的知识时常常难以进行忠实的推理。然而,现有的工作主要关注外部知识和 LLM 的参数化知识之间的冲突,而外部知识之间的冲突在很大程度上尚未得到探索。与此同时,现代 RAG 系统越来越强调非结构化文本和知识图谱(KG)等(半)结构化数据的集成,以提高知识完整性和推理能力 忠实性。为了解决这一差距,我们引入了 ConflictQA,这是一种新颖的基准,可以系统地实例化文本证据和知识图谱证据之间的冲突。对代表性 LLM 的广泛评估表明,面对此类跨源冲突,LLM 往往无法识别正确推理的可靠证据。相反,LLM 对提示选择变得更加敏感,并且倾向于完全依赖 KG 或文本证据,从而导致错误的响应。基于这些发现,我们进一步提出了 XoT,一种基于两阶段解释的思维框架,专为异构冲突证据的推理而设计,并通过大量实验验证了其有效性。