论文
检测LLM幻觉:追踪上下文共享受损的拓扑特征
Detecting Hallucination in LLMs: Tracing the Topological Signatures of Impaired Context Sharing
摘要
本工作考察注意力图中信息流模式的拓扑结构,以有效区分幻觉与非幻觉回复。我们分析Forman-Ricci曲率以识别注意力图中指示信息瓶颈的结构模式,进而提出一种方法,捕捉与幻觉回复相关的注意力头的半局部与全局信息流特征。我们在多个LLM和成熟基准上广泛评估该方法。实证结果表明,所提出的单次前向方法在两个幻觉检测基准上持续优于现有基于注意力和多回复的基线,并在多样化LLM架构上取得有竞争力的表现。进一步分析揭示,因果生成过程中token间上下文共享受损与LLM幻觉的出现强相关。特别是,幻觉回复的一致特征是过度依赖自注意力、对较早token的上下文检索弥散,或信息过度压缩(over-squashing),尤其在最后一个Transformer层。
