论文
注意只是耦合的另一个名字?分层预训练的快慢常微分方程视角
Attention is Just Another Name for Coupling? A Fast-Slow ODE Perspective on Hierarchical Pretraining
摘要
我们将 Transformer 预训练重新解释为沿深度的快慢、奇异扰动流,以不受限的权重作为其非自主特征。线性化动力学是图层图的深度有序乘积。沿着标记同质参考轨迹,线性化层沿着冻结注意力内核的特征基进行分解。经过可计算的饱和深度后,流因子会通过块粗粒度——换句话说,运行各层就是运行粗变量,对偶。衰减束上支持的权重扰动既不会将可区分轨迹的持久分量移动,也不会将冻结内核移动到一阶,因此框架将参数空间划分为可见和不可见方向,慢速路径的跨块耦合完全位于可见侧。慢速路径可以承载多大的门受到稳定裕度的限制。在数据方面:如果区块排放遵循指数族,则区块均值池化会捕获慢速路径可以使用的所有信息;但如果相邻块没有共享结构,则没有跨块通道可以帮助预测,并且门幅度在预测风险中是不可见的。稳定性界定了架构可以做什么;数据决定它的结果。