论文
框架:与分数傅里叶专家混合学习适应域
FRAME: Learning the Adaptation Domain with a Mixture of Fractional-Fourier Experts
摘要
参数高效的 微调 (PEFT) 在固定的基础上重新参数化权重更新:低秩适配器在空间域中运行,而最近的一系列谱方法在固定的傅里叶域中运行。我们认为,领域的选择本身就是一种应该学习的设计自由度,并且没有一个单一的基础在跨任务、层或词元时是最佳的。我们引入了分数傅里叶专家混合,这是一种专家混合适配器,其中每个专家都携带可学习的分数傅里叶阶,该阶数在空间域(恢复普通 LoRA)和傅里叶域(恢复光谱适配器)之间连续插值。通过占据空间谱连续体上不同点的专家来路由词元,可以让模型将每个低秩更新放置在最紧凑的域中,并且——因为不同阶的分数傅立叶算子是相互不相干的——使得专家自然地去相关,从而减少干扰并改善多任务组合。每个专家的阶数是一个标量,使用单独的优化器进行训练,并且变换是使用 $\mathcal{O}(d\log d)$ chirp--FFT 代理计算的,因此与标准 MoE-LoRA 相比,分数傅里叶混合专家增加的成本可以忽略不计。跨越 LLaMA-3.1-8B 和 Qwen2.5-7B 上的常识、数学、代码和知识基准,分数傅立叶专家混合比强大的 MoE-LoRA 和频谱基线(包括 FlyLoRA、FourierMoE 和 HMoRA)有所改进,同时保持较小的活动参数预算,分析表明,学习的顺序以可解释的方式按任务和层进行专门化。