论文

用于事实性检查和幻觉检测的分解蕴涵

Decomposed Entailment for Factuality Checking and Hallucination Detection

模型评测评测方法与指标

摘要

大语言模型 (LLM) 的可靠性经常受到事实不一致的影响,包括幻觉——生成的内容不受底层源支持的情况。我们提出了 HallDetect,这是一种用于幻觉检测的轻量级、无参考的黑盒框架,我们不仅在总结上进行评估,而且在更广泛的基于源的生成设置上进行评估。 HallDetect 建立在基于分解的事实性评估之上:生成的内容被分解为原子声明,每个声明都由基于编码器的紧凑蕴涵模型通过多尺度源块库的对比公式进行验证,并与不对称分数聚合,其中单个自信矛盾的声明标记响应。在所有方法共享相同的 4 位量化骨干网和消费级硬件预算的受控协议下,HallDetect 在四个基准中的三个基准上优于资源相对充足的生成和基于嵌入的基线,同时在骨干网系列中保持稳定,并生成可定位每个错误的声明到跨度审计跟踪。