论文

小规模的密集预训练与稀疏预训练:主动参数匹配与总参数匹配

Dense vs Sparse Pretraining at Tiny Scale: Active-Parameter vs Total-Parameter Matching

模型评测模型能力评测

摘要

我们在共享的 LLaMA 式解码器训练方案下,在小规模预训练体系中研究密集和专家混合 (MoE) Transformer。稀疏模型用混合式路由专家取代了密集的前馈模块。密集基线适度调整宽度,以紧密匹配活动或总参数预算,而分词器、数据、优化器、时间表、深度、上下文长度、标准化样式和评估协议保持固定。我们最好的稀疏方案使用四个专家、top-2 路由、交换机式负载平衡和路由器 z 损失。在三种子全数据比较中,密集主动匹配模型达到 1.6545 +/- 0.0012 最佳验证损失,MoE 达到 1.5788 +/- 0.0020,密集总匹配模型达到 1.5608 +/- 0.0025。这产生了有利于 MoE 的 0.0758 +/- 0.0021 的匹配主动间隙和有利于密集模型的 0.0180 +/- 0.0020 的匹配总间隙。在整个训练过程中,匹配主动优势不断增长,而匹配总密集优势则急剧缩小。因此,在这种低于 25M 参数的情况下,MoE 改善了主动参数匹配下的验证损失,但在相同的总存储容量下并未超过密集训练。