论文

零源LLM幻觉检测与类人准则探查

Zero-source LLM Hallucination Detection with Human-like Criteria Probing

模型评测评测方法与指标

摘要

大型语言模型 (LLM) 经常会产生实际上不正确或不忠实的内容,从而产生幻觉,对其安全使用构成重大风险。在零源约束下检测此类幻觉尤其具有挑战性,因为没有可用的模型内部或外部参考,并且检测必须仅依赖于文本查询-答案对。在本文中,我们提出了幻觉检测的类人标准探测(HCPD),这是一种模拟人类评估者多方面推理的范例。其核心是类人标准探测(HCP)机制,其中 LLM 代理自适应地将其判断分解为一组加权的可解释标准,并将特定标准的分数汇总为最终的真实性度量。为了实现这种自适应能力,我们引入了一种基于奖励的对齐方案,仅使用语义一致性的弱监督。在推理时,我们采用多重采样聚合策略来确保稳健的决策,同时保留完整的可解释性。我们进一步提供理论分析来支持我们方法的可靠性。大量实验表明,HCPD 始终优于最先进的基线,为零源幻觉检测提供了有效且可解释的解决方案。代码可在 https://github.com/TRISKEL10N/HCPD 获取。

零源LLM幻觉检测与类人准则探查:论文配图
图 1:提议的 HCPD 概述。给定查询-答案对 (q,a)(q,a),代理实例化一组特定标准 {ci}i=1m\{c_{i}\}_{i=1}^{m} 和相应的重要性权重 {wi}i=1m\{w_{i}\}_{i=1}^{m}。随后生成标准级部分分数 {si}i=1m\{s_{i}\}_{i=1}^{m} 并聚合成整体真实性度量 sps_{p}。在 GRPO 训练期间,我们通过最大化分数对齐奖励来微调代理,以鼓励预测的 sps_{p} 匹配从基于一致性的相似性度量得出的弱监督标签。在推理时,我们调用代理 KK 次并聚合结果分数以获得可靠的决策 ś\bar{s}。