论文

Omega-S:LLM 微调 的功能弹性指数

Omega-S: A Functional Resilience Index for LLM Fine-Tuning

模型训练持续学习

摘要

微调 新数据上的 大语言模型 会降低其先前学到的知识。我们提出了 Omega-S,这是一种仅根据权重矩阵计算的直接惩罚:它不需要先前的任务数据,不需要 Fisher 矩阵,也不需要存储旧权重的副本。它是现有训练循环中的三行,并且每一步的成本增加不到 4%。保留。在使用 LoRA 的 Llama-3-8B 上,从代码到散文进行微调,并通过 HumanEval 对 10 个种子进行测量,Omega-S 在 10 个种子中的 9 个上保留了比没有正则化更多的原始能力(0.173 -> 0.238 绝对 pass@1;符号测试单侧 p=0.011,Wilcoxon p=0.006),作为保留率,62.9% -> 84.1%。它还击败了 10 颗种子中的 10 颗(p=0.002)的调整权重衰减,以及 10 颗种子中的 8 颗(p=0.014)的调整 EWC(p=0.014),每个手臂都在同一会话中重新测量。机制,是衡量的而不是断言的。 Omega-S 是拓扑结构的,其目标是从 Tr(A^3) 构建的,但我们测量了其四个因子中的哪一个实际移动,三个不移动:它们相对于权重的弹性等于或低于 1e-4,而度方差项的弹性为 9e-3。在实现时,复合材料减少了对节点度方差的惩罚,这意味着方形模块中的行大小和非方形模块中的方向对齐。我们报告这一点是因为一个方法的名称承诺了一件事,而其梯度却做了另一件事,应该这么说。我们还列举了开放式设计选择,包括保留对比度的结构,该结构实现了其设计目的,但使所有十颗种子的保留效果更差。重复相同的配置、相同的种子和相同的硬件,保留率的标准偏差为 0.104。我们还没有发现对低秩 微调 语言模型进行量化,并且它限制了该文献中的每个种子配对比较,包括我们的文献。代码、每个种子的结果以及阴性结果的完整记录均可用。