论文

Transformer 中几何引导的分层 FFN 宽度分配

Geometry-Guided Layerwise FFN Width Allocation in Transformers

模型架构Transformer

摘要

前馈网络 (FFN) 占 Transformer 参数的很大一部分,但它们的隐藏宽度在深度上通常是恒定的。我们询问是否可以通过层行为的前向传递测量来分配此容量。我们将每个 FFN 视为传输词元表示云,并使用保留对应的移位、Gromov-Wasserstein 失真和原始和尺度归一化指标下的一级持久同源来量化引起的几何变化。分层近似代理产生精确的固定预算优化器。在七个预训练的语言模型中,原始欧几里得工作主要跟踪剩余规范的增长,而规范化工作主要是前载的。 Gromov-Wasserstein 工作比有限样本拓扑估计更一致地与基于扰动的层敏感性相关。在配对的 128M 和 256M 训练运行中,相对于均匀宽度和手工设计的余弦锥度,多个归一化工作计划减少了平均验证损失。随着 440M 处放大的配对差异,基于几何的最佳分配比均匀分配的改进大大大于余弦锥度,而反拓扑原始控制则比均匀分配更差。