论文

单索引目标的上下文学习:比较内核学习器和特征学习器

In-context Learning of Single-index Targets: Comparing Kernel and Feature Learners

模型架构Transformer

摘要

上下文学习 (ICL) 使预训练模型能够从演示中推断出任务,而无需更新其参数。虽然许多现有理论都关注线性目标函数,但在本文中,我们通过比较同一系列单索引任务上的两个单层注意力架构来研究非线性情况。内核学习器首先通过固定的非线性特征图映射输入,然后应用线性注意力,而特征学习器将注意力应用到原始输入,然后学习非线性读数。我们使用复制方法得出对其记忆和泛化错误的预测,保留预训练大小、任务池多样性以及训练和推理上下文长度的影响。由此产生的预测与广泛范围内的数值实验非常吻合。我们的分析产生了阶段图,描述了随着预训练数据量、任务多样性和上下文长度的变化,每种架构何时具有优势。我们进一步确定了两个学习者在性质上不同的上下文长度缩放。这些结果共同阐明了架构选择如何与数据集交互并控制非线性上下文学习。