论文
我真的知道吗?学习事实性自验证以减少幻觉
Do I Really Know? Learning Factual Self-Verification for Hallucination Reduction
摘要
事实性幻觉仍是大语言模型(LLM)的核心挑战。现有缓解方法主要依赖外部事后验证,或在微调时将不确定性直接映射为拒答,往往导致过度保守的行为。我们提出 VeriFY,一个训练时框架,教会 LLM 通过基于一致性的自验证对事实不确定性进行推理。VeriFY 用结构化验证轨迹增强训练,引导模型先给出初始答案,生成并回答一个探测性验证问题,作出一致性判断,然后决定作答还是拒答。为应对在增强轨迹上训练时可能强化幻觉内容的风险,我们引入阶段级损失掩码方法,将幻觉答案阶段排除在训练目标之外,同时保留对验证行为的监督。跨多个模型家族与规模,VeriFY 将事实性幻觉率降低 9.7% 至 53.3%,召回率仅有小幅下降(0.4% 至 5.7%),且在单一来源数据上训练后能跨数据集泛化。源代码、训练数据与训练后的模型检查点将在录用后发布。
