论文

稀疏记忆微调作为 LoRA 和完全微调的低遗忘替代方案

Sparse Memory Finetuning as a Low-Forgetting Alternative to LoRA and Full Finetuning

模型训练参数高效训练

摘要

将预训练的语言模型应用于新任务通常会损害其已有的一般能力,这个问题被称为灾难性遗忘。稀疏记忆微调 (SMF) 试图通过向模型添加键值记忆层来避免这种情况,并在每个训练步骤中仅更新当前批次读取最多的一小组记忆行。我们在 Qwen-2.5-0.5B-Instruct 上重新实现 SMF,并将其与 LoRA 进行比较,并在 MedMCQA(一项 4 项选择的医学检查任务)上进行全面微调,使用 WikiText 困惑度和 TriviaQA 准确性作为遗忘探针。 SMF 将 MedMCQA 提高了 2.5 个百分点,同时将两个遗忘探针保持在基本模型的大约 1 个点之内,而 LoRA 和完全微调实现了更大的增益,但两者都有明显的漂移。我们还比较了两种行选择规则(KL-divergence 和 TF-IDF),它们以不同的方式平衡了两个遗忘指标。