论文

通过权重空间模型合并应对 大语言模型 的灾难性遗忘,以便更好地遵循指令

Countering Catastrophic Forgetting of Large Language Models for Better Instruction Following via Weight-Space Model Merging

模型优化模型合并

摘要

大语言模型已在医学领域被采用用于临床记录,以减轻临床医生的负担。然而,研究报告称,在使用特定任务的医学数据集进行微调时,LLM 经常“忘记”大量的指令遵循能力,这是在临床应用中采用通用 LLM 的关键挑战。本研究提出了一个模型合并框架,通过解决这种遗忘问题,有效地将通用 LLM 应用于医学领域。通过基于插值的合并方法将临床基础模型 (GatorTronLlama) 与通用指令模型 (Llama-3.1-8B-Instruct) 合并,我们寻求导出一个在临床任务上具有强大性能的领域适应模型,同时保留指令跟踪能力。跨医学基准和五项临床生成任务(例如放射学和出院总结)的综合评估表明,合并模型可以有效减轻灾难性遗忘,保留临床领域专业知识,并保留遵循指令的能力。此外,我们的模型合并策略展示了训练效率,在严格约束的监督下(例如,64 镜头与 256 镜头)实现了与完全微调的基线相当的性能。因此,权重空间合并构成了一种高度可扩展的解决方案,可将开源 LLM 应用于临床应用,从而促进在资源有限的医疗保健环境中更广泛的部署。