论文

权重空间消融下的跨层交互:注意力雅可比闭式界与预训练模型测试

Cross-Layer Interaction under Weight-Space Ablation: A Closed-Form Attention Jacobian Bound and a Test on a Real Pretrained Model

模型评测模型行为与机制分析

摘要

一个配套论文研究了激活补丁和权重空间裁剪在理想化模型中的关系,该模型中条件计算通过残差流线性叠加。对于该模型中的一个组合,在两个载体架构依赖的情况下,注意力头及其自身层的归一化-MLP组合,它导出了一个精确的一阶交互公式,当仅MLP被裁剪时为零,当注意力头也被裁剪时为二阶的上限。这一结果局限于单个残差块,并且只在小变压器上检查了合成任务。本论文将该结果扩展到两个极限之外。首先,从多个层跨越的裁剪交互分解成相同的块项,每个被触碰的层一个,加上对跨层余下的贡献,该分解不声称其大小。其次,我们精确地隔离这个余下部分,对于两个层,作为二重积分中的混合二阶导数,并命名缺失的成分以限制它:注意力子块的雅可比界。我们通过闭式公式导出这个界限并验证它,在没有违反的情况下,与Qwen2.5-1.5B-Instruct的实际权重相比较,尽管我们尚未跨层链这条界限。我们也给出了在闭式公式中展示的曲率常数,该配套论文的界限未被揭示。第三,在同一模型上,我们搜索并找到了一个涌现的电路用于间接物体识别,从未设计到它,使用原始激活补丁方法进行此任务,并测试崩溃、分离和交互。结果是混合的:在所有五次测试实例中,共享载体浮现,大部分但不是所有情况下崩溃和分离成立,但在同一块内层对之间,三个中的一个测量出非零交互。