论文
论坛:能力保护中从权重空间到功能空间保护 微调
Fora: From Weight-Space to Function-Space Protection in Capability-Preserving Fine-Tuning
摘要
完整的 微调 使 大语言模型 适应新任务,但会削弱它们已经拥有的功能。现有的补救措施通过参数距离、重要性惩罚、输出匹配或权重的主导奇异方向等代理进行保护,但没有直接询问保留的能力依赖于哪些激活方向。我们认为,能力的特征是它所引发的激活子空间,而不是权重矩阵的奇异几何形状,并开发了函数空间保护,实例化为 FORA(函数空间正交残差适应)。根据无标签校准输入,FORA 估计每层输入激活协方差的主方向 $Q$,并形成右投影 $P_Q = I - QQ^T$。与权重 SVD 的左投影仪 $P_U$ 配对,更新为 $ΔW = P_U M P_Q + U_2 D_δ V_2^T$:结构上禁止读取与功能相关的函数方向的高容量分支,加上用于受控可塑性的窄光谱通道。该结构通过 $M \to (α/r) BA$ 扩展到参数有效的自适应。在 Qwen3-1.7B 的三种设置中,包括在保留翻译的同时学习的 COGS 和 GSM8K 以及在保留数学的同时学习的翻译,FORA 持续改进了权重空间投影和标准正则化的保留,在数学保留设置中仅进行了小的新任务权衡。隔离投影源的受控消融表明,优势不是来自投影本身,而是来自投影到能力导出的方向而不是权重导出的方向。代码可在 https://github.com/zrui239/FORA 获取。