论文
微调 陷阱:评估负迁移和 PEFT 在 Sub-1B 数学推理中的作用
The Fine-Tuning Trap: Evaluating Negative Transfer and the Role of PEFT in Sub-1B Mathematical Reasoning
摘要
在边缘设备上部署小语言模型 (SLM) 需要高效的 微调 策略,使模型适应新任务而不降低其一般功能。在本研究中,我们在数学推理任务上对 5 个 sub-1B 模型 (135M-1B) 进行了基准测试,并发现了一个关键漏洞:完整 微调(完整 FT)会主动损害 300M 参数下模型的性能,通常会将精度降低到零样本基线以下。这种“负传递”使得参数高效 微调 (PEFT) 不仅仅是一种效率偏好,更是一种稳定性要求。我们发现,虽然低秩适应 (LoRA) 和权重分解 LoRA (DoRA) 的性能相当,但它们的优势因任务而异; DoRA 擅长复杂推理(GSM8K),而 LoRA 则主导模式匹配(OrcaMath)。特别是,Full FT 在对齐模型 (Qwen2.5-0.5B) 上优于 LoRA,甚至在最小架构 (SmolLM2-135M) 上优于简单的 5 次上下文学习。基于这些发现,我们建议对所有对齐的 sub-1B 模型默认使用 PEFT,并谨慎对待任何小于 500M 参数的架构的 Full FT,以防止灾难性遗忘。这项工作的复制可以在 https://github.com/gulguluu/tiny-slm-finetune-compare 找到。