论文
MechLens:事实知识的后期结晶解释了语言模型中的干预有效性
MechLens: Late Crystallization of Factual Knowledge Explains Intervention Effectiveness in Language Models
摘要
了解 LLM 存储事实知识的位置对于缓解幻觉至关重要。我们系统地量化了晚期结晶:事实知识并不是逐渐跨层出现,而是在最后一层突然“结晶”。在五个模型系列(Pythia、Gemma、Qwen2.5、Llama-3.1、Mistral;0.5--14B)中,26.8%--93.4% 的正确答案从未进入任何中间层的前 10 名预测,而晚出现(>80% 深度)在各个架构中保持一致。跨尺度(Qwen2.5-14B)和跨基准(MMLU:98.2%)结果证实了普遍性;调谐镜头排除了探头伪影。情绪分类控制(Qwen 为 0.5%,事实为 85.9%;Mistral 为 2.0%,事实为 26.8%)证实了该现象特定于事实回忆。晚期结晶产生了结晶引导干预原则:CAA 在中等结晶模型(Llama、Mistral;p<0.001)上优于 DoLa,在高结晶 Qwen 上表现出方向一致的逆转(+25.4% vs. +15.5% MC1,p=0.069)。 LayerNorm 烧蚀表明结晶是残余流所固有的; LN 缩放 (x1.2) 产生 +11.8% MC1,推理开销为零。我们进一步揭示了可计算性记忆谱:可计算知识比记忆事实(28.0/28)更早结晶(第 22.1/28 层)。我们发布了支持五个型号系列的 MechLens。