论文

用于幻觉检测的交叉释义不变性学习

Cross Paraphrastic Invariance Learning for Hallucination Detection

模型评测评测方法与指标

摘要

大语言模型 (LLM) 经常产生幻觉,而源文档不支持这种幻觉。为了避免昂贵的 LLM 作为评估器管道和现有分类器的繁重注释需求,我们提出了 CPIL(交叉释义不变学习),这是一个两阶段连体框架,可最大限度地利用现有标记数据。具体来说,CPIL 通过以下方式构建信息训练对:(i)生成每个文档声明示例的释义视图作为正例,并显式地对齐它们的表示以强制表面形式的不变性; (ii) 挖掘相同文档、相反标签对作为硬底片,以锐化文档敏感的决策边界。然后 CPIL 进行两阶段 模型训练:第 1 阶段执行对比预训练,以学习释义不变、基础感知的嵌入空间;第二阶段附加了一个轻量级分类器以实现证据支持性的二分类判别。在 LLM-AggreFact 基准(11 项任务)上,CPIL 仅用约 1% 的标记数据就超越了有关 F1 分数的强大基线,显示了其预测优势和标记效率。