论文

教育部专业化中的几何不对称:功能解相关和表征重叠

Geometric Asymmetry in MoE Specialization: Functional Decorrelation and Representational Overlap

模型评测模型架构MoE模型行为与机制分析

摘要

专家混合 (MoE) 架构通过稀疏路由实现可扩展的容量,但专家专业化的几何结构仍然知之甚少。我们引入了一个统一的 Jacobian-PCA-Grassmann 框架,用于分析函数空间和表示空间中的 MoE 层。在预训练的 MoE Transformer(Mistral、Qwen)中,我们发现了一致的结构不对称性:专家表现出很强的功能去相关性(始终较低,接近零的交叉专家雅可比对齐),而他们的路由表示占据不同但部分重叠的子空间。这表明功能去相关和表示重叠在 MoE 专业化中共存而不是重合。受控路由实验进一步表明,路由稀疏性似乎是塑造这种几何形状的关键因素:top-k 路由导致更尖锐的功能分离和更大的子空间发散,而完全软路由产生更纠缠的专家结构。总之,这些结果提出了一种几何解释,其中 MoE 层可以被视为在共享表示流形上的重叠子流形上实现局部去相关算子,并为研究现代 Transformer 架构中的条件计算提供了通用诊断框架。