论文

通过选择性参数优化实现 大语言模型 中的高效任务适应

Efficient Task Adaptation in Large Language Models via Selective Parameter Optimization

模型训练参数高效训练

摘要

大语言模型(LLM)在通用语言理解、生成等任务中表现出了优异的性能。然而,当微调用于特定领域任务时,预训练阶段积累的常识往往会因参数更新而被部分覆盖或遗忘,这严重限制了LLM的泛化能力和可迁移性。传统的微调策略大多在整个参数空间上进行训练,忽略了模型参数的异质性,即某些参数对于一般任务极其重要,而其他参数则对特定任务更为敏感。为了缓解上述问题,本文创新性地提出了参数元素重要性评估方法,通过区分参数对于一般语言能力任务和特定领域任务的重要性,将参数分为“核心参数”和“非核心参数”,并在微调期间固定核心参数,仅对非核心参数进行微调。使用 GPT-J 和 LLaMA-3 对科学、医学和物理任务进行的大量实验表明,我们的方法可以减轻灾难性遗忘,同时增强模型的适应性。