论文

面向不确定性幻觉检测的多样性导向微调

Diversity-Oriented Fine-Tuning for Uncertainty-Based Hallucination Detection

模型训练监督微调与指令调优

摘要

现有幻觉检测方法通常在推理阶段进行,不对模型本身做任何修改。本文关注探索能让最终模型的幻觉更易被检测的微调策略。聚焦基于语义熵的检测,我们观察到许多错误输出未被检出,因为模型在多次生成中产出了几乎相同的错误答案。为此,我们提出多样性导向微调,鼓励更多样的生成。我们给出两种具体策略:一种基于监督微调(SFT),另一种基于直接偏好优化(DPO)。我们开展大量实验评估该方法,并分析微调前后模型行为的变化。我们发现,采用我们的微调方法后,模型对幻觉答案产出低语义熵响应的可能性降低,从而提升幻觉检测的有效性,最终取得优于或与最先进方法相当的结果。代码将公开。

面向不确定性幻觉检测的多样性导向微调:论文配图
图2:面向多样性的微调数据构建。 SFT 管道为每个问题生成多个语义等效的答案,为每个不同的答案创建一个训练实例。 DPO 管道构建偏好对,其中高多样性答案集优先于重复的低多样性输出,鼓励多样化但语义忠实的生成。