论文

INTRYGUE:面向可靠RAG不确定性估计的归纳头感知熵门控

INTRYGUE: Induction-Aware Entropy Gating for Reliable RAG Uncertainty Estimation

模型评测评测方法与指标

摘要

虽然检索增强生成(RAG)显着提高了大语言模型的事实可靠性,但它并不能消除幻觉,因此强大的不确定性量化(UQ)仍然至关重要。在本文中,我们揭示了由于机械悖论,标准的基于熵的 UQ 方法在 RAG 设置中经常失败。上下文利用所固有的内部“拉锯战”出现了:虽然感应头通过复制正确答案来促进接地反应,但它们同时触发了先前建立的“熵神经元”。这种相互作用会增加预测熵,导致模型在准确输出上发出错误的不确定性信号。为了解决这个问题,我们提出了 INTRYGUE(用于不确定性估计的感应感知熵门控),这是一种基于机械原理的方法,可根据感应头的激活模式来门控预测熵。经过四个 RAG 基准和六个开源 LLM(4B 至 13B 参数)的评估,INTRYGUE 始终匹配或优于 UQ 的各种基准。我们的研究结果表明,RAG 中的幻觉检测受益于将预测不确定性与上下文利用的可解释的内部信号相结合。

INTRYGUE:面向可靠RAG不确定性估计的归纳头感知熵门控:论文配图
图 7:各种非线性变换 (ff) 对 INTRYGUE 性能的影响。较高的 AUROC 分数映射到更靠近中心的位置。应用非线性变换并不能显着提高性能。