论文

深度何时对情境学习很重要?深度自适应推理 Transformer

When Does Depth Matter For In-Context Learning? Adaptive Inference in Deep Transformers

模型评测模型行为与机制分析

摘要

Transformer 通过许多连续的注意力和前馈块执行计算,使它们能够学习大量耦合变量之间的复杂相关性。什么时候在多层上堆叠连续的注意力前馈计算比单个 Transformer 块具有计算优势?我们通过检查广义线性注意力 Transformer 中的上下文学习来解决这个问题。我们首先在 Transformer 中介绍分布式推理的一般理论,但受到通信和深度的限制。我们表明,此类系统可以利用内部表示(“函数向量”)来推断其层上越来越精细的潜在上下文变量。对于上下文中的线性回归任务,该理论预测,虽然没有前馈块的单层 Transformer 对于上下文变量的高斯先验来说是最佳的,但多层 Transformer 对于非高斯、树状先验来说更优越。经过训练的线性注意力 Transformer 重现了理论的定量预测。使用因果密钥修补实验,我们验证了中间层中的函数向量可以调节信息的自适应路由。我们的结果表明,深度和前馈块使 Transformer 能够实现自适应推理,当潜在变量的分布具有分层结构时,这是有利的。