论文

坚持你所知道的:知识对齐监督 微调 的研究

Stick to What You Know: A Study of Knowledge-Aligned Supervised Fine-Tuning

模型训练合成数据

摘要

有监督的 微调 (SFT) 训练基础语言模型来模仿目标响应,而这些目标可能需要基础模型尚未稳健内化的知识。我们将其作为幻觉的来源进行研究,并将一组缓解方法定义为 \emph{知识对齐 SFT}:将 SFT 训练目标限制为基础模型的参数化知识。在统一的设置下,我们比较了现有的基于生成和基于估计的知识对齐方法,并引入了两种新的变体:证据重写(Evidence Rewrite)和召回重写(Recall Rewrite),前者使用外部证据验证基本模型生成,后者仅在基本模型能够一致召回时才保留声明。 Qwen 3 4B 和 OLMo 3 7B 的实验表明,知识一致的 SFT 可以减少 WildHalu 和 Biography 上的事实幻觉,同时在很大程度上保留一般能力。 Recall Rewrite 可产生最强的事实性收益并改善 UnknownBench 上的拒绝行为。从而证实 SFT 的目标超出了基础模型的知识驱动幻觉行为。