论文

追踪知识传播的极限:LLM如何在知识冲突的多步推理中失败

Tracking the Limits of Knowledge Propagation: How LLMs Fail at Multi-Step Reasoning with Conflicting Knowledge

模型评测基准与评测资源

摘要

缓解大语言模型(LLM)中过时或错误信息的常见方案,是通过上下文或知识编辑提供更新事实。然而,当知识更新未能覆盖模型参数化知识时,这些方法引入知识冲突,并传播到错误推理。然而,当前针对该问题的基准大多只关注单次知识更新与事实回忆,不评估这些更新如何影响下游推理。在本工作中,我们提出 TRACK(Testing Reasoning Amid Conflicting Knowledge),一个研究 LLM 在新知识与模型初始参数化知识冲突时如何把它传播到多步推理的新基准。TRACK 覆盖三个推理密集场景(WIKI、CODE 与 MATH),引入多重、现实的冲突以反映真实世界复杂性。我们在 TRACK 上的结果显示,向模型提供更新事实进行推理,可能比不提供任何更新事实更糟,且随着提供更多更新事实,性能退化加剧。我们表明这一失败既源于无法忠实整合更新事实,也源于即使知识已整合时推理仍有缺陷。TRACK 提供一个严格的新基准,用于测量并引导未来在多步推理中传播冲突知识的进展。

追踪知识传播的极限:LLM如何在知识冲突的多步推理中失败
图5:我们三个 Track 场景的数据生成流程。每条流程以 Wikidata( Vrandečić and Krötzsch, 2014 )、BigCodeBench( Zhuo et al., 2025 )或 PRM800K( Lightman et al., 2024 )为数据来源,产出五个关键组件:多步推理问题 q q 、最终答案 a a 、原子事实 K q K_{q} 、探测性问题 q i q_{i} 和探测性答案 a i a_{i} 。每个组件的生成方法由一个图标标示:分别对应确定性脚本、基于 LLM 的生成,以及二者兼有的混合方法。没有图标的组件直接改编自现有基准。