论文
一阶可预测但成对脆弱:经过训练的 Transformer 中的局部任务适应
First-Order Predictable but Pairwise Fragile: Local Task Adaptation in Trained Transformers
摘要
任务算术、顺序 微调、激活引导和一阶随机搜索都通过围绕已训练检查点的相对较小的扰动进行操作,并且它们依赖于不同的局部近似:个体扰动应该是一阶可预测的,任务更新应该由受控干扰组成,有用的切线结构应该是稳定的并且可以估计,权重编辑应该在表示空间中具有对应项。我们使用围绕多任务 LoRA 操作点的相同Harness在 9 Transformer (82M-7B) 上测量 8 个此类属性,并使用预期注册的属性列表、阈值和测试分割。我们发现了一个共享的单向有效性窗口,最高可达测试规模 $10^{-2}$,但没有用于成对组合或更新排序的通用半径。沿着各个方向,探针损耗的变化在整个网格中保持一阶可预测:扰动对损耗的影响本质上是其在梯度上的投影,这也是局部随机搜索起作用的原因。然而,事实证明,成对结构要脆弱得多:在超过三分之一的测量(模型、任务对)组合中,两次更新顺序敏感性严格设置在该窗口内;任务梯度子空间在数十步内旋转;我们的固定激活探针下的可加性在多个模型(包括两个保留的 7B 模型)上在完整任务向量规模上失败;并且没有模型中值通过已注册的全局平均向量权重与转向对应栏。对于两个连续的任务梯度步骤,前导顺序相关项是李括号 $H_B\textbf{g}_A-H_A\textbf{g}_B$;其归一化预测 $c(η)=ηκ+O(η^2)$ 以中位数比率 1.002 跟踪测量的缺陷,而起始尺度 $η^\dagger\approx0.10/κ$ 在模型和任务对之间跨越三个数量级。