论文

Hallucination-R1:面向稳健性的释义生成以实现事实一致性

Hallucination-R1: Robustness-Oriented Paraphrase Generation for Factual Consistency

模型训练合成数据

摘要

事实幻觉通常是由不正确的事实输出来定义的。我们研究了释义引起的幻觉设置,其中模型以其原始形式正确回答了事实问题,但在语义等效的释义下生成了错误的答案。这种不一致暴露了语义不变性下潜在的事实不稳定性。然而,通用目的的释义通常不足以作为面向鲁棒性的监督:近似复制的释义提供微弱的信号,而过度多样化的释义可能会破坏语义对等。在本文中,我们提出了 HALLUCINATION-R1,一种面向鲁棒性的释义生成框架,它学习生成语义上忠实但鲁棒性具有挑战性的释义,以实现事实的一致性。通过两阶段优化,它首先稳定意义保留和多样化释义,然后奖励揭示下游 QA 模型中事实一致性退化的释义。 SimpleQuestions、PopQA 和 TruthfulQA 上的实验表明,HALLUCINATION-R1 实现了很强的一致性——多样性权衡,并暴露了跨多个模型系列和数据集的鲁棒性故障。进一步的分析表明,这些失败不能简化为表面级的工件或语义漂移,而是揭示了意义保留变化下的重要事实不稳定性。一项轻量级微调研究还表明,HALLUCINATION-R1 生成的数据提高了释义变化下的鲁棒准确性,表明其对于鲁棒性导向训练的实用性。我们的代码和模型可通过此 https URL 公开获取。