论文

为什么 微调 会鼓励产生幻觉以及如何解决它

Why Fine-Tuning Encourages Hallucinations and How to Fix It

模型训练监督微调与指令调优

摘要

大语言模型 很容易产生事实上不正确的陈述的幻觉。这些错误的一个关键来源是通过受监督的 微调 (SFT) 接触新的事实信息,这可能会增加在 预训练 期间获得的知识的幻觉。由于这些错误是知识退化的副产品,因此我们探讨现有的持续学习工具是否可以减轻这些错误。我们提出了一种基于自我 蒸馏 的 SFT 方法,该方法可以促进有效的事实学习,同时通过规范输出分布漂移来最大限度地减少对现有知识的幻觉。我们还表明,当不需要获取新知识时,通过冻结参数组来抑制事实可塑性可以保留任务性能,同时减少幻觉。最后,我们研究了其机制,对比容量限制、行为克隆和局部干扰。我们的实验表明,主要驱动因素是重叠语义表示之间的干扰,自我 蒸馏 减轻了这种干扰,并且联想记忆模型解释了:遗忘随着新事实和存储事实之间的重叠而增长。