论文

FourierMoE:大语言模型 的傅里叶混合专家改编

FourierMoE: Fourier Mixture-of-Experts Adaptation of Large Language Models

模型训练参数高效训练

摘要

参数高效的 微调 (PEFT) 已成为在计算预算有限的情况下适应 大语言模型 (LLM) 的关键范例。然而,标准 PEFT 方法通常在多任务 微调 设置中遇到困难,其中不同的优化目标会导致任务干扰,而有限的参数预算会导致代表性不足。虽然最近的方法结合了专家混合 (MoE) 来缓解这些问题,但它们主要在空间域中运行,这可能会引入结构冗余和参数开销。为了克服这些限制,我们重新制定了谱域的自适应。我们的频谱分析表明,不同的任务表现出不同的频率能量分布,并且 LLM 层表现出不同的频率敏感性。受这些见解的启发,我们提出了 FourierMoE,它将 MoE 架构与离散傅里叶逆变换 (IDFT) 相集成,以实现频率感知自适应。具体来说,FourierMoE 采用频率自适应路由器将词元分发给专门从事不同频段的专家。每位专家学习一组共轭对称复系数,保留完整的相位和幅度信息,同时从理论上保证无损 IDFT 重建为实值空间权重。对 28 个基准、多个模型架构和尺度的广泛评估表明,FourierMoE 在单任务和多任务设置中始终优于竞争基线,同时使用的可训练参数明显减少。这些结果凸显了谱域专家自适应作为 LLM 微调 的有效且参数高效范例的前景。