论文
SAPE:大语言模型 微调 中的三明治适配器可提高参数效率
SAPE: Sandwich Adapters for Parameter Efficiency in Large Language Model Fine-Tuning
摘要
虽然参数高效 微调 (PEFT) 通过减少可训练参数的数量大大降低了适应 大语言模型 (LLM) 的硬件成本,但最近的研究试图通过参数共享进一步改进 PEFT。然而,这些方法要么采用跨层的统一参数共享,这可能会延迟收敛,要么依赖动态掩蔽策略,这会增加计算开销。受 Transformer 架构的固有层次结构启发的共享模式的潜力在 PEFT 中仍未得到探索。为了解决这一差距,我们引入了 SAPE(用于参数效率的三明治适配器),这是一种基于三明治式硬权重共享拓扑的 PEFT 框架。 SAPE 通过平衡共享组适配器路由中间 Transformer 层,同时严格隔离输入嵌入和最终投影边界变换以防止梯度干扰。这种设计显着减少了内存消耗,同时消除了与动态参数共享方法相关的计算开销。对纯编码器和因果解码器架构的广泛评估表明,SAPE 在低参数状态下实现了最先进的性能。在自然语言理解方面,SAPE 在 RoBERTa-large 上的表现优于 proPETL,同时仅利用基线参数预算的 10%。在严格的约 0.6M 参数约束下使用 LLaMA-3.2 (3B) 进行自然语言生成和世界知识推理时,SAPE 优于 AdaLoRA,在 GSM8K 上产生 +4.85% 的绝对改进,在 CommonsenseQA 上产生 +3.11% 的绝对改进。此外,通过全面的拓扑消融,我们形式化了固有的容量权衡:虽然硬参数共享强烈地规范了语义泛化,但它稍微平滑了严格的多步算术推理所需的尖锐的分层变换。