将幻觉信号弱监督蒸馏进Transformer表征
Weakly Supervised Distillation of Hallucination Signals into Transformer Representations
摘要
现有面向大语言模型(LLM)的幻觉检测方法依赖推理时的外部验证,需要金标准答案、检索系统或辅助裁判模型。我们探究这种外部监督能否转而在训练期间被蒸馏进模型自身的表征,使推理时仅凭内部激活即可进行幻觉检测。我们提出一个弱监督框架,组合三种互补的证据依托信号:子串匹配、句子嵌入相似度以及LLM作为裁判(LLM-as-a-judge)的裁决,在无人工标注的情况下将生成回复标记为有据或幻觉。利用该框架,我们从SQuAD v2构建了一个15000样本的数据集(10500个训练/开发样本和独立的5000样本测试集),其中每个样本将LLaMA-2-7B生成的答案与其完整的逐层隐藏状态及结构化幻觉标签配对。随后我们直接在这些隐藏状态上训练五个探测分类器:ProbeMLP(M0)、LayerWiseMLP(M1)、CrossLayerTransformer(M2)、HierarchicalTransformer(M3)和CrossLayerAttentionTransformerV2(M4),仅将外部证据依托信号作为训练期监督。我们的核心假设是:幻觉检测信号可被蒸馏进transformer表征,从而在推理时无需任何外部验证即可实现内部检测。结果支持这一假设。基于transformer的探测器取得最强判别力:M2在5折平均AUC/F1上表现最佳,M3在单折验证与留出测试评估中均表现最佳。我们还对推理效率进行基准测试:探测器延迟为0.15至5.62毫秒(批处理)和1.55至6.66毫秒(单样本),端到端生成加探测的吞吐量保持在约0.231查询/秒,表明实际开销可忽略不计。
