论文
模型增长到底增加了什么?超越参数数量的功能能力
What Does Model Growth Really Add? Functional Capacity Beyond Parameter Count
摘要
模型增长将参数添加到经过训练的检查点并继续训练,旨在增加容量,同时重用现有模型,而不是从头开始训练。但是,培养经过训练的模型是否真的会创造出能够在后续训练中生存下来的新功能能力?仅靠参数计数无法回答这个问题,而且“容量”本身就是不明确的;它可以指参数计数、有效维度或表示新函数的能力。我们直接测量它,作为增长步骤添加的新的、功能独立的方向的数量,形式化为模型的函数雅可比行列式的等级增量和规模上的无矩阵估计。对于零门控函数保持增长,在横向条件下,这个增量恰好是$K$,即$\operatorname{rank}(J_{\mathrm{grown}})=\operatorname{rank}(J_{\mathrm{old}})+K$。持续训练跨三个域从 $253\mathrm{M}$ 增长到 $857\mathrm{M}$ 参数的 Transformer,我们发现这些添加的方向持续存在,所有 $K=36$ 在持续学习后保持独立,即使模型灾难性地忘记(困惑 $28\to481$)或我们故意破坏旧函数($25.9\to127$)。因此,几何容量和保留功能是解耦的。增长引入的功能能力仍然存在,而先前学习的功能则不会保留。第二种几何上不同的机制 Net2Net 从初始化时休眠的方向($0 \to K$)达到相同的 $K$ 维容量,然后保留它,因此解耦不是特定于零门参数化的。其含义是准确的。灾难性遗忘不一定反映功能能力的丧失,仅保留维度不足以保留学习的功能。