论文
输出稀释:MoE 模型中冗余但脆弱的表示
Output Dilution: Redundant but Fragile Representations in MoE Models
摘要
专家混合(MoE)模型似乎可以像密集模型一样稳健地编码道德内容,但事实证明其编码要脆弱得多。在 OLMoE-1B-7B 中,线性探针从几乎所有专家层组合中恢复道德效价,平均峰值层准确度高于 90%。但这些表示在激活噪声水平下崩溃了,而尺寸匹配的密集模型很容易容忍,鲁棒性差异为 4.2 倍。我们将其追溯到产出稀释。由于 MoE 块在贡献残差流之前对活跃专家进行平均,因此到达下游层的前馈信号比密集 MLP 中的前馈信号小了近两个数量级。道德信息,我们的兴趣,在聚合中完好无损,但其规模却被扰动所淹没。路由本身在噪声下保持稳定,而漏洞完全源于稀释聚合。检查点轨迹证实这是架构性的,而不是学习性的。专家从不专业化,准确性在最初的几千步内就饱和了。在稀疏架构中,冗余编码并不意味着鲁棒编码。