论文

从标记到语义:利用互补信号在黑盒中进行幻觉检测 LLM

From Tokens to Semantics: Leveraging Complementary Signals for Hallucination Detection in Black-Box LLMs

模型推理推理验证与自校正

摘要

当 LLM 支持面向公众或高风险工作流程时,错过的制造可能会损害用户和机构,而错误警报会消耗有限的人工审核能力。当没有可信上下文或参考文档可用时,我们研究可通过黑盒模型 API 访问的两个信号:语义熵,用于测量采样响应含义之间的分歧,以及从词元对数概率得出的不确定性。它们的故障模式可以是互补的:当响应形成一个语义簇时,语义熵变得无信息,而词元不确定性可能会错过一致的置信错误。我们通过 TopK 方法聚合采样响应中的 词元级 信号来扩展基于标记的不确定性检测,评估混合 CoCoA 方法,该方法将目标响应不确定性与语义相异性相结合,并提出和研究两种监督方法:Gated(将单集群案例路由到聚合标记特征分类器)和 Stacked(联合从语义不确定性和更广泛的标记特征中学习)。我们使用四种语言模型评估了七个基准,包括五个公共基准(四个文本数据集和多模式手写支票提取)和两个构建的基准(财务摘要和长文本质量保证)。在我们对模型和数据集的评估中,Stacked 在近一半的情况下提供了最佳性能,而 TopK 和 CoCoA 在没有监督训练标签的情况下仍然具有竞争力,尽管它们的阈值需要仔细校准。没有一种方法是普遍有效的。因此,我们评估假阳性率预算从 1% 到 15% 的性能,评估其对生成和校准选择的敏感性,并检查数据集特征之间的变化。