论文
cMoLLM规模化:LLM混合的水平扩展定律
cMoLLM at Scale: Horizontal Scaling Laws for Mixture-of-LLMs
摘要
规模化驱动了大语言模型(LLM)的成功,但稠密Transformer将容量与计算耦合:每个参数在每个token上都被激活,使训练与推理成本随模型规模线性增长——当模型逼近万亿参数量级时,这成为关键瓶颈。我们旨在通过LLM管线全程的MoE式混合(而非仅在FFN中)来扩展容量。先前的管线级方法包括引入虚拟token与并行流但开销巨大、且存在同质化路由与梯度坍缩问题的ParaScale,以及使用辅助预测分支但适应性有限、收敛缓慢的AltUp。我们确立:MoE式混合层可以被重构为可变核动态卷积,其中每个专家对应一个1×1卷积核,路由实现输入条件化的核聚合。基于这一等价性,我们提出cMoLLM:一种通过完全可微动态卷积在端到端流上进行路由的卷积门控LLM混合。在FineWeb上训练的GPT-2风格模型中,cMoLLM在同等算力下改善了语言建模困惑度以及GLUE和SQuAD下游准确率,相比ParaScale与AltUp风格基线具有更好的流利用率、更稳定的优化和更有利的扩展性。
