论文
零源LLM幻觉检测与类人准则探查
Zero-source LLM Hallucination Detection with Human-like Criteria Probing
摘要
大型语言模型 (LLM) 经常会产生实际上不正确或不忠实的内容,从而产生幻觉,对其安全使用构成重大风险。在零源约束下检测此类幻觉尤其具有挑战性,因为没有可用的模型内部或外部参考,并且检测必须仅依赖于文本查询-答案对。在本文中,我们提出了幻觉检测的类人标准探测(HCPD),这是一种模拟人类评估者多方面推理的范例。其核心是类人标准探测(HCP)机制,其中 LLM 代理自适应地将其判断分解为一组加权的可解释标准,并将特定标准的分数汇总为最终的真实性度量。为了实现这种自适应能力,我们引入了一种基于奖励的对齐方案,仅使用语义一致性的弱监督。在推理时,我们采用多重采样聚合策略来确保稳健的决策,同时保留完整的可解释性。我们进一步提供理论分析来支持我们方法的可靠性。大量实验表明,HCPD 始终优于最先进的基线,为零源幻觉检测提供了有效且可解释的解决方案。代码可在 https://github.com/TRISKEL10N/HCPD 获取。
