论文

线性注意力可以从上下文中的非线性教师那里学到什么?

What can linear attention learn from nonlinear teachers in-context?

模型评测模型架构Transformer模型行为与机制分析

摘要

线性注意力是一种易于处理的模型,用于理解 Transformer 中上下文学习的控制机制。对于线性回归任务,最近的渐近分析描述了其学习和泛化行为。我们将此理论扩展到非线性单指标目标 $y=f(x^\top w)+\varepsilon $。我们的主要结果建立了非线性噪声等价性:线性注意力仅提取$f$的线性埃尔米特分量,而其余的非线性结构作为有效噪声对泛化误差做出贡献。这种化归允许将相应线性理论的结果转移到非线性任务。我们阐释了它对有限预训练数据的影响,以及随着任务多样性的增加从任务记忆到任务泛化的转变的影响。这些结果确定了简化线性注意力模型的局限性,并为研究非线性上下文学习提供了一个易于处理的起点。