论文

CausalGaze:通过 大语言模型 中的反事实图干预揭示幻觉

CausalGaze: Unveiling Hallucinations via Counterfactual Graph Intervention in Large Language Models

模型推理推理验证与自校正

摘要

尽管 大语言模型 (LLM) 取得了突破性的进步,但幻觉仍然是其在高风险领域部署的关键瓶颈。现有的基于分类的方法主要依赖于内部状态的静态和被动信号,这些信号通常会捕获噪声和虚假相关性,而忽略了潜在的因果机制。为了解决这一限制,我们通过引入 CausalGaze(一种基于结构因果模型(SCM)的新型幻觉检测框架)将范式从被动观察转变为主动干预。 CausalGaze 将 LLM 的内部状态建模为动态因果图,并采用反事实干预将因果推理路径与偶然噪声分开,从而增强模型的可解释性。跨越四个数据集和三个广泛使用的 LLM 的大量实验证明了 CausalGaze 的有效性,特别是与最先进的基线相比,TruthfulQA 数据集上的 AUROC 提高了 3.3%。