论文
第一个词元知道:幻觉检测的单解码置信度
The First Token Knows: Single-Decode Confidence for Hallucination Detection
摘要
自我一致性通过生成问题的多个采样答案并测量一致性来检测幻觉,但这需要重复解码,并且可能对词汇变化敏感。语义自一致性通过使用自然语言推理对采样答案进行聚类来改善这一点,但它增加了采样成本和外部推理开销。我们表明,第一个词元置信度 phi_first 是根据单个贪婪解码的第一个内容承载答案词元处的前 K 个 logits 的归一化熵计算得出的,匹配或适度超过了闭卷简答事实问答的语义自我一致性。在三个 7-8B 指令调整模型和两个基准测试中,phi_first 的平均 AUROC 为 0.820,而语义一致性为 0.793,标准表面形式自一致性为 0.791。包含测试表明 phi_first 与语义一致性中度至强相关,并且结合两个信号仅比单独的 phi_first 产生较小的 AUROC 改进。这些结果表明,多样本一致性捕获的大部分不确定性信息已经在模型的初始词元分布中可用。我们认为,在调用基于采样的不确定性估计之前,应将 phi_first 报告为默认的低成本基线。