论文

知道却说不出:用Recall-Anchored Distillation预防LLM SFT中的事实访问失败

Knowing but Not Saying: Preventing Factual Access Failures in LLM SFT via Recall-Anchored Distillation

摘要

监督微调(SFT)可能损害目标域之外的事实性表现。这种退化常被描述为灾难性遗忘,但开放式的事实失败并不必然意味着底层事实已被抹除。在这项工作中,我们识别出一个更具体的现象——事实访问失败:域SFT之后,模型在受限评估下仍能识别或排序出正确答案,却在闭卷生成中无法将其产出。通过基准级比较、同一事实的选择题与生成探针以及失败模式分析,我们表明SFT诱发的事实退化既包含真实的错误答案生成,也包含表达层面的失败,如冗长、格式不匹配与精确匹配伪影。为解决这一问题,我们提出Recall-Anchored Distillation(RAD),一种以基座为锚的自蒸馏目标:在无标注OOD文本上,将适配后的模型与原始基座模型的软续写分布对齐,从而保持分布外生成行为。RAD无需黄金OOD答案、外部裁判或标注的事实数据。在三个于MedMCQA上微调的骨干上,RAD恢复了相当一致的已丧失OOD召回部分,同时保持目标域适配。与在相同OOD文本上做重放相比,RAD表明关键的保持信号是基座模型的软分布,而非额外的文本暴露本身。

知道却说不出:用Recall-Anchored Distillation预防LLM SFT中的事实访问失败:论文配图
图1:事实访问失败的诊断概览。面板(a)将潜在事实存储与可观测行为区分开:识别、回忆和表达。面板(b)展示发现1中的基准级比较。面板(c)展示发现2中的同一事实诊断。