论文
冻结核心需要任务信号:用于低资源 LLM 适应的费舍尔白化互协方差
Frozen Cores Need Task Signal: Fisher-Whitened Cross-Covariance for Low-Resource LLM Adaptation
摘要
参数高效的 微调 通常被视为要更新多少参数的问题。然而,在严格的可训练国家预算下,这些系数的作用同样重要。我们通过冻结核心适应来研究这个选择:校准过程修复每个权重矩阵的左右基数,并且 微调 仅优化 $r\times r$ 核心。这消除了可训练因子修复不良初始跨度的能力,并使子空间质量可以直接观察到。我们引入 FCCA,它估计带符号的输入误差互协方差,用对角费舍尔矩将其白化,在生成的局部度量中截断它,将选定的方向映射回来,并应用薄 QR 以获得稳定的核心坐标。在匹配的 $r^2$ 预算下,我们比较了 11 个任务的 8 个基础构造函数、4 个模型设置和 3 个种子。在 Qwen2.5-3B 上,FCCA 的宏观平均值达到 83.0,比第二最佳匹配预算构造函数高出 2.3 分,并且在所有 11 项任务上都超过了其未白化的 RawGrad 控制。它在所有三个 Qwen 量表中均排名第一,并且与 Llama-3.2-1B 上的最佳方法相差 0.13 分以内。受控消融显示美白带来 2.7--17.2 点的增益,并确定 QR 对于测试体系中稳定的核心优化是必要的。最后,FCCA 的平均分与 LoRA 和 DoRA 相差 0.32 和 0.23,同时优化了 36.9K 个参数,而不是大约 7.4M 个参数。这些结果表明,精心选择的固定跨度可以以小得多的可训练和优化器状态成本恢复可移动低秩因子的大部分好处。