论文

数据稀缺和模型稀疏:专家混合对重复数据的过度拟合

Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data

模型评测模型行为与机制分析

摘要

随着人类书写文本的供应耗尽,重复语言 模型训练 数据已成为标准做法。先前的工作已经研究了密集激活的 Transformer 的数据重复,但对于最近占主导地位的稀疏架构(例如专家混合(MoE)),数据重复的影响在很大程度上仍未被探索,尽管它们提高了计算效率。我们在单域和多域数据混合以及教育部设置之间改变数据重复率,包括专家数量和粒度。我们一致发现,对于从 80M 到 1B 活跃参数(总共 8.5B)的模型,MoE 在数据重复下退化得更快。这种效应随着稀疏性的增加而增加,这是由总参数而不是活动参数决定的。虽然 80M 密集模型可以重复数据超过 8 倍且性能下降最小,但 MoE 在 4 倍时开始受到影响,并迅速恶化,在所有独特的数据设置中放弃其性能优势,在 32 倍后表现不如密集模型。我们尝试使用现有的正则化方法作为潜在的补救措施。我们发现一些方法(例如 dropout)可以减轻过度拟合。特别是,通过强大的基于掩蔽的正则化,即使数据重复超过 64 次,MoE 也能够胜过密集模型。然而,没有一种方法能够完全匹配所有独特训练数据的性能。最后,我们分析了高重复情况下与 MoE 过度拟合相关的内部机制,发现 MoE 路由在训练早期普遍稳定,并且专家专业化与重复数据的过度拟合相关。总之,我们的工作解决了稀疏性和数据重复之间的不利相互作用:我们提供了过度拟合的核心机制及其潜在补救措施的证据,并为未来的方法提出了有希望的途径,通过破坏记忆模式来减少模型参数的过度专业化。