论文

视觉扩散中的稀疏专家混合路由 Transformer:诊断、边界校准和从路由崩溃到选择性死锁的进化路线图

Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock

摘要

本文系统地诊断了视频扩散 Transformer 上词元选择稀疏专家混合 (MoE) 的训练失败模式。从大约 50 亿个参数的预训练密集模型开始,我们将其转换为遵循三个定律的 MoE 架构:路由专家精确克隆原始 FFN 权重,共享专家初始化为零以进行验证,然后初始化为极小的非零噪声以进行实际训练,而只有门网络从随机初始化开始。实验揭示了五种故障模式的层次结构:(1)线性路由器遭受完全专家同质化的全局软饱和; (2) MLP 路由器引入选择性死锁,其中大约三分之一的层退化为单专家模式,无法通过增加辅助损失来防止; (3)交叉注意力路由器表现出初步的自我恢复能力,但大约九层仍然顽固地陷入僵局; (4)死锁层呈U型分布,集中在浅层视觉处理层和深层语义整合层; (5) bfloat16 混合精度导致微小的权重更新被硬件截断为零。基于跨 5,000 个训练步骤的超过 6500 万个词元的路由决策时间序列,我们提出了功能冗余假设:死锁是门共享专家路由专家三元系统中共享专家成熟之前的理性等待策略。这一假设得到了系统生物学中功能冗余理论的支持。在工程方面,我们总结了密集到MoE转换的三定律,并为bfloat16精密陷阱提供了完整的解决方案。我们校准了 Token-Choice 范式的当前能力边界,并概述了从视觉统一到世界模型的三步演化路线图。