论文

部分大于总和:用于多策略高效训练的自动任务排序 LLM

The Parts Are Greater Than the Sum: Automated Task Sequencing for Efficient Training of Multi-Policy LLMs

模型训练参数高效训练

摘要

参数高效的 微调 (PEFT) 通常使用单个共享低秩适配器 (LoRA) 来适应 大语言模型。在适应异构任务序列时,这种共享的优化空间经常受到干扰,导致迁移不良和灾难性遗忘。现有的方法主要通过增加参数容量或组合多个适配器来提高适配器的表达能力,但它们仍然依赖于共享的优化路径。在本文中,我们提出了一种用于 大语言模型 的参数高效 微调 的优化路径组织框架,作为自动多策略 PEFT 架构实现。具体来说,在固定参数预算下,通过任务分组和任务排序自动组织优化兼容的适应路径。有组织的优化路​​径被实现为独立的量化低秩适配器(QLoRA),使得异构任务能够在解耦的适应空间中进行优化,同时保持兼容任务之间的正向转移。 TRACE 基准测试表明,从传统的单策略 PEFT 到多策略 PEFT,性能持续提高,所提出的自动多策略框架在相同的可训练容量下实现了 44.78 的最佳性能。这表明优化路径组织比简单地增加异构参数高效 微调 的适配器容量更有效。