论文

LLM 幻觉检测的约束释义一致性

Constrained Paraphrase Consistency for LLM Hallucination Detection

模型评测评测方法与指标

摘要

大语言模型 (LLM) 可以生成与事实不一致的声明,从而激发准确且可扩展的幻觉检测器。先前的工作在很大程度上通过综合或新注释扩大了训练集,引入了增加的成本和潜在的偏差,同时没有充分利用语义等效释义所暗示的一致性。我们提出了一致性约束幻觉检测器(CCHD),它将训练制定为约束优化问题。原始文档-声明对上的标准交叉熵由 (i) 界定释义视图之间分歧的释义一致性约束,以及 (ii) 将释义与 真值 联系起来的标签保留约束进行补充。我们通过模型参数和每个视图拉格朗日乘子的梯度下降-上升来解决该问题,仅添加一些标量双变量并且没有推理时间开销。凭借 DeBERTa 和 Flan-T5 主干,CCHD 在标准事实基准上始终优于强大的基线(FactCG、MiniCheck 和 AlignScore),展示了其在幻觉检测方面的优越性。