论文
敏感性、因果关系和修复分离:扰动鲁棒性及其尺度的分层分析
Sensitivity, Causality, and Repair Dissociate: A Layer-Wise Analysis of Perturbation Robustness and Its Scaling
摘要
当语言模型在表面扰动的输入(打字错误、OCR 噪声、同音字)上失败时,“哪一层负责”具有三种自然的操作:表征分歧最大的地方(敏感性),恢复干净的激活可以恢复预测的地方(因果关系),以及小适配器可以修复损坏的地方(补偿能力)——我们展示了这三层图的分离。在五个模型面板中,我们确定了两种传播机制 - 尖峰抑制(Phi-3.5、Gemma-2-9B)和后期积累(Llama-3、Mistral、Qwen2.5-7B) - 并且在满足 80% 身份补丁门的两个模型上,敏感性和因果关系是反相关的(rho = -0.72 至 -0.88)。 Qwen2.5(1.5B 至 14B)上的族内标度显示后期积累特征随标度单调增强,这在第二个族上得到了证实。我们提出级联破坏作为解离背后的机制:放置在因果关系早期层的适配器会破坏完整的下游计算,使诊断标记的站点成为最差的适配器放置位置。横跨四个模型 (3.8-8B) 的固定Harness层证实了对 GSM8K 思想链的核心预测 - 标记的位点是每个可裁决模型上最具破坏性的适配器窗口 - 并且符号一致,但在多项选择控制上强烈衰减,与与生成长度复合的损害一致。扫描产生了实用指导:无需训练 LRD 预筛选和默认最深放置规则,尽管相对于无适配器基线的绝对增益仍然很小。最后,在充足的生成预算下,表征稳定性损失带来的明显收益会逆转——被截断的思想链被评分为空——这是对思想链任务评估的任何干预措施的方法论警告。