论文

遗忘的热带几何视角:用于保存知识的单机投影仪微调

A Tropical Geometry View of Forgetting: A Per-Unit Projector for Knowledge-Preserving Fine-Tuning

模型训练持续学习

摘要

微调新文本的语言模型降低了它已有的功能。 Adam-NSCL 和 GPM 等免重放投影仪禁止在更新的每一行中共享一个层输入的子空间。 ReLU 层的热带几何结构说明了为什么它太粗糙。在数据空间中,单元的墙是热带超曲面,其单元与区域的上顶点是对偶的;在权重空间中,每个旧的token都是一个超平面,而token则切出一个多面体,权重的闭合使每个token保持在其一侧。两个图片之间有一个精确的恒等式:在任何权重变化下层输出的平方变化分为单元内、开到闭和闭到开项,前两个项在每个单元触发的token上生效。该身份命名了一个门感知的每单元投影仪,并且预算分离定理为精确的保护定价:它花费一个单元其自己的开放token的秩,而共享子空间至少支付每行中它们的联合的秩。在 OPT-1.3b 上,96% 的(token,单位)对是闭合的,投影仪在从每行 9 到 60 个约束方向的所有 6 个匹配预算中忘记的数量少于 Adam-NSCL,差距从 $1.1\times$ 扩大到 $4.3\times$;使用 1/5.5 的方向,它可以将 Adam-NSCL 在 GPM 能量阈值下的遗忘减半。在 OPT-6.7b 上,它与 Adam-NSCL 在匹配预算的同时了解更多信息的遗忘相匹配。正如理论预测的那样,开/闭分区是操作变量:开token在 18 个种子对中的 18 个上击败随机、符号盲和反门token集。在剪枝修复中,密集权重处输出误差的每个基于导数的局部模型对打开的对都是盲目的:门加权目标的最小化器可以离开多面体,目标的封闭形式解比 OPT-1.3b 上的无修复差 1.94 nat,并且凸单边惩罚限制了逃逸。

遗忘的热带几何视角:用于保存知识的单机投影仪微调的原论文方法或结果图
图 6:在一个预算下,哪一个(token,单位)配对约束成立。具有 $d=30$ 输入、$m=10$ 单元和 $T=24$ 旧token的随机 ReLU 层。如何读取网格。每一行是一个单元,即该层的第一个权重矩阵(OPT中的fc1)的一行,每一列是一个旧的token,因此行$i$和列$t$中的单元格是对$(t,i)$。行按单元触发的token数量排序,最活跃的位于顶部。列按照 (b) 的共享子空间容纳它们的数量排序,大部分位于左侧。每个网格中的顺序都是相同的,因此给定的单元格位于 (a)–(d) 中的相同位置。 (a) 基本模型的门模式,读出旧token上的一次前向传递:当token $t$ 上的单元 $i$ 打开时,单元是暗的,即 $z_{i}(x_{t})>\theta$,其中 $\theta$ 为门阈值(ReLU 为 $0$)。行右侧的栏计数该单元的打开token。顶部单元在 $24$ token的 $8$ 上触发,下一个单元在 $6$ 上触发,底部单元则不触发。 $240$ 对中仅 $38$、$16\%$ 处于打开状态;在 OPT-1.3b 中,份额为 $4\%$。 (b)–(d) 单元的阴影是各向同性权重更新对该对的预激活影响(约束已消除)的分数:白色表示该对保持自由,全色表示它被完全保留。这些点重复 (a) 中的空对。行右侧的条形是该行中约束禁止的方向数,虚线标记平均值,对于每个系列来说都是 $3$。网格下的条形是空对的平均阴影。持有闭合对只能防止其开口。 (b) Adam-NSCL、GPM、InfLoRA 和 AlphaEdit 的共享子空间禁止旧输入二阶矩的顶部 $3$ 特征方向,并且禁止在每一行中使用它们。因此,每一行都花费 $3$ 方向,并且单元格的阴影仅取决于其列:最左边的token保存在每行的 $83\%$ 上,最右边的保存在 $8\%$ 上。顶部单元的 $8$ 开口token固定在 $9\%$ 和 $78\%$ 之间。总体 $56\%$ 的开对效果保持不变。 (c) 保护整个单元的方法冻结整行; HAT 和 AGS-CL 根据旧任务使用情况选择它们,MIGU 根据新数据量选择它们。冻结行花费了其所有 $30$ 方向(箭头),因此 $3$ 的平均值购买了十分之一的冻结行。最上面一排被冻结了。它的token的所有$24$都被保留,包括它关闭的$16$,并且没有其他行保存任何东西,所以开对的$21\%$的效果被保留。 (d) 我们的投影仪为单元 $i$ 提供预算 $k_{i}=\min(C,\#\text{open})$ 和上限 $C=4$,并将其花在该单元自己的具有最大激活的开放token上。因此,顶部单元在 $54\%$、$22\%$、$14\%$ 和 $10\%$ 处准确地保持其 $4$ 最活跃的开路token,而其其他 $4$ 仅部分开路token。 $3$ 打开的单元token准确地容纳所有 $3$,而从不发射的底部单元接收 $k_{i}=0$ 并且不容纳任何东西。预算从上到下是 $4,4,4,4,4,3,3,3,1,0$,这也是 $3$ 的平均值,并且保持开对效应的 $85\%$。 (e) §4.2 的选择器控件,为顶部单元绘制。其$24$旧token按预激活$z$排序,如左侧打开token的条形所示,虚线为墙。八个已开放,其预算为$k_{i}=4$。每行标记一个选择器花费预算的 $4$ token。该门采用$4$最活跃的打开token。 Random-within-open随机取$8$的$4$打开token,这里与门共用一个。一阶准则取 $4$ token中最大的 $|\partial L/\partial z|$;由于该导数在闭token上为零,因此它也保留在开集内。随机token抽取所有$24$中的$4$,这里落在$1$打开和$3$关闭token上。符号盲准则取$4$最大的$|z-\theta|$,即$2$最开放和$2$最深封闭的token,反门取$4$最深封闭的。每行花费相同的$k_{i}$;仅token发生变化。