论文
从原语验证残差架构:尖锐的稳定性阈值
Certifying Residual Architectures from Their Primitives: A Sharp Stability Threshold
摘要
深度残差架构训练是否稳定通常是通过对其进行训练来确定的,这种方法成本高昂,并且只能回答测试的架构、深度和浮点格式的问题。在实践中,稳定性是通过启发式方法来确保标准化的位置和使用哪种类型的,这些方法得到了实验的支持,但缺乏共同的原则。我们表明,可以在训练之前直接从残差块的架构原语中证明稳定性,作为深度和浮点格式的显式函数。该证书有两个元素:(a) 幂律增长边界,$|v(x)|\le c|x|^q+b$,其指数 $q$ 是通过指数算术(向前)从块的基元计算得出的; (b) 块上可达状态(向后)的 Lipschitz 条件的梯度边界。证书确定状态何时可以达到最大有限浮点值$M$:对于$q\le1$,溢出至少需要$\log M$阶,而对于$q>1$,它可以发生在$\log_q\log M$阶内;阈值 $q=1$ 是尖锐的。每个归一化和有界激活都会设置 $q=0$,并且算术会识别出在没有归一化的情况下将块从 $q>1$ 带到 $q=1$ 的最小修改。根据经验,在预测中,只有 $q>1$ 区块会爆炸,正如远期证书所预测的那样。在 OpenWebText 上的 GPT-2 中,未经标准化的 $q=1$ 块也会发散:前向证书成立,而后向证书在具有最大查询密钥系数的注意块中失败。将归一化从 $q=0$ 放宽到 $q=1$ 可以提高算子学习中的分布外泛化能力和时间序列预测的准确性。随着深度模型变得越来越复杂且训练成本越来越高,我们的结果提供了一种在训练之前直接从块基元评估稳定性和表示灵活性之间权衡的方法。