论文

使用 Transformer 理解非线性回归的上下文学习:注意力作为特征器

Understanding In-Context Learning for Nonlinear Regression with Transformers: Attention as Featurizer

模型评测模型行为与机制分析

摘要

经过预训练的 Transformer 能够从提示中提供的示例中学习,而无需任何权重更新,这是一种被称为上下文学习 (ICL) 的非凡能力。尽管 ICL 已在各个领域表现出功效,但对 ICL 的理论理解仍在发展中。尽管大多数现有理论都集中在线性模型上,但我们在非线性回归环境中研究 ICL。通过注意力机制中的交互机制,我们显式地构建了 Transformer 网络来实现非线性特征,例如多项式或样条基,它们涵盖了广泛的函数类别。基于此构造,我们建立了一个框架来分析具有构造特征的端到端上下文非线性回归。我们的理论提供了上下文长度和训练集大小方面的有限样本泛化误差范围。我们对综合回归任务的理论进行了数值验证。