论文
用于 词元级 幻觉检测的时间多信号融合
Temporal Multi-Signal Fusion for Token-Level Hallucination Detection
摘要
词元级 幻觉检测器独立于单个信号对每个标记进行评分,并且当生成模型确信错误时会失败。相反,本文将幻觉视为时间上延伸的跨度,并通过序列标记来检测它:每个标记都是从融合了文本统计、自然语言推理 (NLI) 蕴涵和语言模型惊喜的 33 维特征流中评分的,无法访问模型内部。基于这些特征的双向门控循环单元 (BiGRU) 在 RAGTruth(10 个种子)上的 AUC 达到 0.840,比独立逻辑回归基线提高了 11 点(p = 0.002,Wilcoxon 符号秩)。受控分解将大部分增益归因于时间顺序而不是模型容量:证据从可靠的位置传播到跨度内的模糊邻居。同样的 0.845 上限在循环、状态空间 (Mamba) 和注意力架构中重复出现,将瓶颈定位在特征集而不是模型中。因为它只读取生成的文本和外部信号,所以检测器在闭源模型上工作,并且它继续处理在训练期间从未见过的语言模型生成的文本,AUC 损失低于 4%。