论文

我真的知道吗?学习事实性自验证以减少幻觉

Do I Really Know? Learning Factual Self-Verification for Hallucination Reduction

模型训练监督微调与指令调优

摘要

事实性幻觉仍是大语言模型(LLM)的核心挑战。现有缓解方法主要依赖外部事后验证,或在微调时将不确定性直接映射为拒答,往往导致过度保守的行为。我们提出 VeriFY,一个训练时框架,教会 LLM 通过基于一致性的自验证对事实不确定性进行推理。VeriFY 用结构化验证轨迹增强训练,引导模型先给出初始答案,生成并回答一个探测性验证问题,作出一致性判断,然后决定作答还是拒答。为应对在增强轨迹上训练时可能强化幻觉内容的风险,我们引入阶段级损失掩码方法,将幻觉答案阶段排除在训练目标之外,同时保留对验证行为的监督。跨多个模型家族与规模,VeriFY 将事实性幻觉率降低 9.7% 至 53.3%,召回率仅有小幅下降(0.4% 至 5.7%),且在单一来源数据上训练后能跨数据集泛化。源代码、训练数据与训练后的模型检查点将在录用后发布。

我真的知道吗?学习事实性自验证以减少幻觉
图1:多个模型家族的基础模型及其衍生的知识探测(knowledge probing)、自洽性(self consistency)和 VeriFY 模型在正确回答率与错误回答率上的帕累托前沿。知识探测和自洽性主要通过弃答来减少幻觉,这导致正确回答率大幅下降。相比之下,VeriFY 在正确回答率仅有轻微下降的情况下实现了大幅的幻觉减少。