论文

解构预训练:MoE与稠密模型中的知识归因分析

Deconstructing Pre-training: Knowledge Attribution Analysis in MoE and Dense Models

模型评测模型架构MoE模型行为与机制分析

摘要

混合专家(MoE)架构将模型容量与每token计算解耦,使扩展得以超越稠密缩放定律施加的计算极限。然而,MoE架构如何塑造预训练期间的知识获取,以及这一过程与稠密架构有何不同,仍属未知。为解决这一问题,我们提出Gated-LPI(Log-Probability Increase),一个神经元级归因指标,将对数概率增量分解到各神经元。我们对MoE与稠密架构的知识获取动态进行了时间分辨比较,分别跟踪1.2M训练步(约5.0T tokens)与600K训练步(约2.5T tokens)的检查点。实验揭示三种模式:(1)低熵主干。MoE中约前1%的神经元捕获超过45%的正向更新,形成高效用核心,而稠密基线中不存在这一现象。(2)早期固化。MoE模型在不到100K步内锁定稳定的重要性分布,而稠密模型在整个训练过程中始终波动。(3)功能鲁棒性。掩蔽MoE中最重要的十个注意力头使关系型HIT@10下降不到10%,而稠密模型下降超过50%,表明稀疏性促成分布式而非脆弱的知识存储。这些模式共同表明,稀疏性从训练早期就促成本质上稳定且分布式的计算主干,有助于弥合稀疏架构与训练时可解释性之间的差距。