论文

TRE:面向扩散语言模型的免训练幻觉检测

TRE: Training-Free Hallucination Detection for Diffusion Language Models

模型推理推理验证与自校正

摘要

扩散大语言模型(D-LLM)近来受到日益关注,但其可靠性因幻觉问题而显著受限。现有针对D-LLM的幻觉检测方法主要遵循基于训练的范式,依赖数据驱动训练来优化检测器。这种依赖不仅限制了其在不同领域与模型间的泛化性,还带来额外的训练成本与部署开销。为解决这些局限,我们提出TRE,一个面向D-LLM的免训练幻觉检测指标。TRE是一个无参数、单次运行的指标,直接从单次生成的熵信号估计幻觉风险,无需任何检测器训练或重复采样。TRE在D-LLM解码过程中沿空间与时间两个维度提取熵信号。从token级空间视角出发,我们着重揭示哪些token是最具信息量的不确定性载体,捕捉不确定性被实际提交的位置。从扩散步级时间视角出发,我们通过经验分析确定后期步熵占主导,进而用简单的线性加权方案聚合这些信号得到TRE。在多个D-LLM与问答数据集上的大量实验表明,TRE取得了有竞争力的性能,同时具备强泛化性、高效率与鲁棒性。

TRE:面向扩散语言模型的免训练幻觉检测:论文配图
图 1:概述 (a) D-LLM 的生成过程和 TRE 的两个关键组成部分,即 (b) 基于启示状态的证据构建和 (c) 时间加权证据聚合。