论文

GRADE:决定小语言模型微调中哪些梯度何时进入

Which and When to Admit: Gradient Admission for Data-Centric Small Language Model Finetuning

模型训练参数高效训练

摘要

LoRA 微调使小语言模型 (SLM) 适应低秩更新子空间内的异构指令数据,使其容易受到三个结构问题的影响:取消冲突的梯度、无法跟踪不断发展的学习动态的静态数据选择以及导致后续更新覆盖有用方向的子空间饱和。因此,我们认为有效的适应需要控制哪些数据引起的梯度进入 LoRA 子空间以及何时进入。我们提出了 GRADE(梯度-Aligned Data-centric rEcipe),这是一个以数据为中心的框架,结合了两种机制:一个状态感知选择器,不断接纳与不断发展的多任务梯度字段对齐的样本,以及一个自校准步进级门,拒绝可能导致接近饱和的破坏性覆盖的更新。在三个当前一代 骨干模型 和异构七数据集指令池中,GRADE 在准确性和鲁棒性方面优于强大的数据选择和 PEFT 稳定基线。它是在每个架构上持续改进标准 LoRA 的唯一方法,同时产生更连贯的梯度轨迹和更少破坏性的覆盖。这些结果表明,成功的 SLM 适应不仅取决于选择哪些数据,还取决于允许哪些梯度进入并保留在受约束的更新子空间中。

GRADE:决定小语言模型微调中哪些梯度何时进入:论文原图
图 2:GRADE 概览。在每次迭代中,当前模型状态都会评分并接纳梯度对齐的样本(机制 1),并监控已接纳批次的损失,以通过自校准步骤级准入门来决定基础 LoRA 是否接纳当前步骤或在更新的状态反馈到机制 1 之前截断当前步骤(机制 2)。