论文
为更新评分,而不是词元:组合 LoRA 专家的下降对齐路由
Score the Update, Not the Token: Descent-Aligned Routing for Combinatorial LoRA Experts
摘要
LoRA 专家混合方法通过将每个词元路由到一些低秩专家来提高低秩适应的能力。几乎所有这些都将每个专家的一个输入侧因素与一个输出侧因素联系起来,并且几乎所有这些都通过对词元进行评分来进行路由:路由器在不查看他们会写什么的情况下选择专家。我们认为路由器应该对更新进行评分。首先,将专家的更新添加到层输出可以通过该更新与输出处的负损失梯度之间的内积来降低损失。这种有用性在词元中是二次的,因此在词元中呈线性的路由器只能看到它贯穿词元均值的部分,而根据自己的激活范数对专家进行排名的路由器永远不会看到输出因子。如果每个专家被分为读者(下投影)和作者(上投影),则每个读者-作者对的有用性成为共享等级 $r$ 空间中的内积,并且所有 $N_AN_B$ 对都可以从 $N_A+N_B$ 向量进行评分。我们以这一身份构建 VANE。低秩罗盘预测每个词元的下降方向。 VANE 通过其更新和指南针之间的对齐对每对进行评分,而不形成任何更新,激活具有附加门的顶部 $k$ 对,并为每对提供精确的一阶路由器梯度。在单域常识推理和 Llama-3.2-3B 和 Llama-3.1-8B 的四域多任务混合上,VANE 在 12 个 PEFT 和 MoE-LoRA 基线中获得了最佳平均值,分别为 0.9--1.1 和 1.3--1.5 分,可训练参数不到 8 专家 MoE-LoRA 的一半。它的路由器分数还比词元路由器更密切地跟踪专家的有用性。