论文

多项式展开阶自适应:通过高阶交互增强低秩 微调

Polynomial Expansion Rank Adaptation: Enhancing Low-Rank Fine-Tuning with High-Order Interactions

模型训练参数高效训练

摘要

低秩适应(LoRA)是大语言模型(LLM)高效微调广泛使用的策略,但其严格的线性结构从根本上限制了表达能力。权重更新的双线性公式仅捕获低秩因子之间的一阶依赖性,限制了非线性和高阶参数相互作用的建模。在本文中,我们提出了多项式展开秩自适应(PERA),这是一种将结构化多项式展开直接引入低秩因子空间的新颖方法。通过在组合之前扩展每个低秩因子以合成高阶交互项,PERA 将适应空间转换为多项式流形,能够在不增加秩或推理成本的情况下建模更丰富的非线性耦合。我们提供的理论分析表明,与现有的线性适应方法相比,PERA 提供了增强的表达能力和更有效的特征利用。根据经验,PERA 在各种基准测试中始终优于最先进的方法。值得注意的是,我们的实验表明,合并高阶非线性分量(尤其是平方项)对于增强表达能力并在各种等级设置下保持强大和鲁棒的性能至关重要。我们的代码可在 https://github.com/zhangwenhao6/PERA 获取