论文
ExpPLoRe:多目标掩模图像建模的专家补丁级损失路由
ExPLoRe: Expert Patch-Level Loss Routing for Multi-Objective Masked Image Modeling
摘要
多目标掩模图像建模 (MIM) 结合了互补的学习信号(标记 蒸馏、CLS 对齐和像素重建),但现有方法用全局标量对这些目标进行加权,忽略了补丁之间的空间异质性。我们提出了 ExPLoRe(专家补丁级损失路由),它将专家软混合 (MoE) 调度权重重新用作学习的每个补丁损失系数。关键机制是损耗耦合:允许损耗梯度通过调度权重流向路由器,从而实现内容相关的专业化,其中不同的补丁在目标之间接收不同的重点。分离消融证实了损耗耦合是核心机制,当梯度被阻塞时,性能会降低 1.6%。在使用 ViT-Base 的 ImageNet-1K 上,ExPLoRe 在两种目标组合(Token+CLS:+0.5% k-NN、+4.4% 线性探针;Token+Pixel:+2.2% k-NN)上改进了非 MoE 基线,实现了 80.6% 的线性探针和 85.3% 的微调精度,与已发布的方法相比具有竞争力。对于下游传输,我们开发了适应方案(冻结路由、专家丢弃和冻结注意力),与普通 MoE 相比,MoE 微调提高了 +1.5%,并缩小了 2.5--2.9 mIoU 分割差距,使 MoE 模型匹配或超过 ADE20K 上的非 MoE 基线。