论文

问题在于条件数:为什么 GLU 比非 GLU 结构更好?

The Devil is in the Condition Numbers: Why is GLU Better than non-GLU Structure?

模型评测模型行为与机制分析

摘要

门控线性单元 (GLU) 及其变体在现代开源 大语言模型 架构中被广泛采用,并且始终优于非门控单元,但这种优势的根本原因仍不清楚。在这项工作中,我们通过分析神经正切核 (NTK) 体系中的两层网络来研究 GLU。我们的分析表明,GLU 结构重塑了 NTK 谱,从而导致更小的条件数和更紧凑的特征值分布。基于这一发现,我们进一步分析了由此产生的训练动态,并展示了重塑频谱如何导致 GLU 模型更快收敛,包括在 GLU 和非 GLU 模型之间观察到的特征损失交叉现象。最后,我们凭经验观察到 GLU 在减少各种模型(包括 ViT 和 GPT-2)上的泛化差距方面的影响有限,这表明它的主要好处在于加速优化而不是减少泛化差距。该代码位于:https://github.com/Zemdalk/GLU-NTK。