论文

CLEAR-MoE:通过校准驱动层选择从 Frozen Vision Transformer 中进行共享基础专家提取

CLEAR-MoE: Shared-Basis Expert Extraction from Frozen Vision Transformers via Calibration-Driven Layer Selection

摘要

我们提出了 CLEAR-MoE,这是一个四阶段 后训练 管道,可将冻结的预训练 Vision Transformer (ViT) 转换为稀疏专家混合 (MoE) 模型,而无需更新主干权重。该管道 (i) 通过稀疏性、可聚类性和输出敏感性对前馈网络 (FFN) 层进行评分; (ii) 使用 k 均值聚类将所选层分解为共享的低秩 SVD 基础和每簇残差专家; (iii) 训练由集群标签监督的轻量级路由器; (iv) 通过可插入的 CUDA 后端调度词元。在使用 DeiT-Small 的 Imagenette 上,CLEAR-MoE 保留了密集模型 99.9% 的准确度(86.70 +/- 0.02% 与 86.73%)。广泛的消融研究揭示了一致的经验发现:共享 SVD 基础是保持准确性的主要因素。随机路由、学习路由和三种不同的路由器架构产生几乎相同的性能,但准确度最多相差 0.06 个百分点 (86.62%-86.68%)。在不同的 SVD 等级、专家数量 (2-8)、校准集大小 (50-500) 和随机种子中,准确性也保持稳定。这种行为可以推广到五个 ViT 主干(DeiT-Tiny、DeiT-Small、DeiT-Base、ViT-Small 和 ViT-Base),涵盖 5.7M 到 86.6M 参数的模型,与密集模型相比,精度差异 <= 0.10 个百分点。在 GTX 960 GPU 上,路由和分散收集开销使 CLEAR-MoE FFN 比密集实现慢 1.3-1.7 倍。调度微基准进一步表明,路由比专家矩阵乘法受内存限制大一个数量级,这表明融合调度内核是未来优化的一个有希望的方向。