论文
循环 Transformer 的稳定性和泛化
Stability and Generalization in Looped Transformers
摘要
循环 Transformer 承诺通过在较难的问题上花费更多的迭代来实现测试时的计算扩展,但目前尚不清楚哪些架构选择可以让他们在测试时推断出较难的问题,而不是记住特定于训练的解决方案。我们引入了一个基于定点的框架,用于沿着三个稳定性轴(可达性、输入依赖性和几何形状)分析循环架构,并使用它来表征定点迭代何时产生有意义的预测。从理论上讲,我们证明没有召回的循环网络具有可数的固定点,并且无法在任何频谱范围内实现强输入依赖性,而召回与外部归一化相结合可靠地产生了一个固定点同时可达、输入局部平滑并得到稳定反向传播支持的范围。根据经验,我们在国际象棋、数独和前缀和上训练单层循环 Transformer,并发现下游性能跟踪框架跨任务和架构配置的预测。我们还引入了内部回忆,这是一种新颖的回忆放置变体,并表明一旦应用外部标准化,它就会与标准回忆放置竞争,并且在数独上明显优于标准回忆放置。