论文
机制性理解为何记忆的知识在LLM微调中无法泛化
Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning
摘要
微调LLM注入新知识面临关键挑战:LLM能快速记住新事实,却无法在下游推理任务中使用它们。我们把该失败形式化为“知道—使用差距”——以准确率差距与记忆和泛化之间的时间滞后为特征。为理解该现象,我们用未见知识微调LLM,并使用称为自修补的新颖干预技术监视知识的内部空间渗透动力学。自修补识别重定位表示可实质改善失败泛化案例的激活位置。结果与知识电路错位假说一致:记忆的表示可以内部存在,但可能未被路由到计算有效的层。为演示该诊断发现的实用性,我们设计一个简单启发式策略——在泛化失败中恢复58–75%的oracle余量。实验跨域执行以验证发现的鲁棒性。
