论文
预测的预测(PoP):大语言模型 中单通道幻觉检测的层间激活融合
Prediction of Prediction (PoP): Inter-Layer Activation Fusion for Single-Pass Hallucination Detection in Large Language Models
摘要
自回归 大语言模型 (LLM) 通常会生成事实上不正确的输出,且解码置信度很高,从而限制了它们在高风险工作流程中的部署。当模型对错误断言过于自信时,现有的输出阶段不确定性指标可能会失败,而多样本验证管道会带来大量的内存和延迟开销。这项工作评估了生成过程中的内部隐藏状态转换动态是否可以在没有辅助解码调用的情况下发出事实错误信号。我们引入了预测的预测(PoP),这是一种通过在单次前向传递期间融合跨深度的中间隐藏表示来捕获层转换不确定性的机制。使用自回归 Transformer 主干网在 TruthfulQA 基准上进行评估,PoP 在事实正确性分类方面实现了 75.5% 的接收者操作特征曲线下面积 (AUROC)。该机制在基本前向传递中运行,增加了不到 1.2% 的运行时延迟,并且需要零额外的生成传递。数值结果是根据作者验证的实验实施报告的,并受下述评估范围的限制。