论文

TriLens:用于白盒幻觉检测的逐层Logit Lens熵

TriLens: Per-Layer Logit-Lens Entropy for White-Box Hallucination Detection

模型评测评测方法与指标

摘要

当语言模型产生幻觉时,最终答案是错的,但这一错误未必在模型内部不可见。在输出产生之前,不同的内部通路可能仍不确定,在收敛速度上各不相同,或已各自锁定相互竞争的续写。我们提出TriLens,一个把这一直觉转化为紧凑表示的白盒检测器:它在每一层通过模型自身的logit lens读取多头自注意力输出、前馈输出和残差流,然后只记录每次读取的熵。得到的3L维轨迹描述了确定性如何沿深度和跨模块形成,而无需存储高维隐藏状态或采样多个生成结果。这一简单信号在指令微调LLM和问答基准上构成了强大的检测器,我们的分析表明三条模块级熵轨迹提供了互补证据。TriLens表明,幻觉检测可以从追踪内部计算如何稳定下来中获益,而不仅仅看最后一层预测了什么。

TriLens:用于白盒幻觉检测的逐层Logit Lens熵:论文配图
图 2:TriLens 概述。对评估序列进行一次前向传递即可提取每一层的 MHSA 输出、FFN 输出和残余流;每个都通过模型的 Logit 透镜进行投影,转换为香农熵,连接成 3​L3L 维特征,并馈送到探针。