SpecDrop:用于模块化专业化的无参数类别条件路由
SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization
摘要
专家混合 (MoE) 网络通过学习路由器、门和负载平衡损失来追求专业化,但在匹配的总参数预算下,学习路由器的性能可能低于等权重无路由基线。瓶颈是路由算法,还是训练信号粒度和目标类别之间的一致性?我们用 SpecDrop 来探讨这个问题,这是一种固定的无参数路由方案:每个 $K$ 分支接收其指定类别的权重 $p_a$ ,否则有一个小的泄漏 $p_i > 0$,通过与类别无关的固定分母合并,没有学习的路由参数,也没有辅助损失;推理时需要类别标签。在每张图像都有一个超类标签(ResNet-110 上的 CIFAR-100;ViT-S/16 上的 ImageNet-1K)的视觉任务中,SpecDrop 在 CIFAR-100 上达到 79.23%,在 ImageNet-1K 上达到 79.89%,超出了不使用标签的参数匹配基线(在 CIFAR-100 上超过密集 +4.75;在 CIFAR-100 上超过密集 +6.53) ImageNet-1K 上的无路由+SE 控制)。这些收益量化了通过路由部署时监督购买的类别——与基线的标签感知部署相比并不具有优势:给定相同的标签,屏蔽密集模型的输出仅在准确性方面更强(85.2 / 83.7)。 SpecDrop 的贡献是将标签转换为经过训练的模块化结构:68%/100% 分支类别对齐,以及 0.00 (CIFAR) / +1.06 (ImageNet) 的掩蔽增益——输出空间限制在很大程度上是在训练期间内化的。在模糊分区上,训练单元跨越多个类别(使用 30M Transformer 的 SlimPajama-6B 语言建模;使用 LoRA 对 Llama-3.2-1B 进行 SuperNI 指令调整),路由机制简化为种子噪声内匹配的无路由控制,即我们论文预测的空值。当路由有帮助时,进行本地化的是粒度对齐,而不是算法选择。代码:https://github.com/Beryex/SpecDrop