论文

检测LLM幻觉:追踪上下文共享受损的拓扑特征

Detecting Hallucination in LLMs: Tracing the Topological Signatures of Impaired Context Sharing

模型推理推理验证与自校正

摘要

本工作考察注意力图中信息流模式的拓扑结构,以有效区分幻觉与非幻觉回复。我们分析Forman-Ricci曲率以识别注意力图中指示信息瓶颈的结构模式,进而提出一种方法,捕捉与幻觉回复相关的注意力头的半局部与全局信息流特征。我们在多个LLM和成熟基准上广泛评估该方法。实证结果表明,所提出的单次前向方法在两个幻觉检测基准上持续优于现有基于注意力和多回复的基线,并在多样化LLM架构上取得有竞争力的表现。进一步分析揭示,因果生成过程中token间上下文共享受损与LLM幻觉的出现强相关。特别是,幻觉回复的一致特征是过度依赖自注意力、对较早token的上下文检索弥散,或信息过度压缩(over-squashing),尤其在最后一个Transformer层。

检测LLM幻觉:追踪上下文共享受损的拓扑特征:论文配图
图 1:当来自许多 token 的信息仅通过承担表征全部上下文负担的单一 token 传递时,就会发生信息过度挤压(over-squashing)。然而,该中心 token 及其前驱未能从后续 token 获得足够的注意力,阻碍了有效的上下文共享。在本例中,所有信息都经过 token T4,但随后由于 T5 上的高自注意力,来自较早 token 的信息大量丢失。线条粗细和颜色表示从先前 token 流向后续 token 的信息量。