论文

序列相关性如何改变上下文学习的有效长度与架构选择

Sequential Correlations Change In-Context Learning: Effective Context Length and Architectural Mismatch

模型评测模型行为与机制分析

摘要

现代序列模型具有惊人的上下文学习(ICL)能力;他们只能根据提示中给出的示例执行新任务。了解这种能力是如何出现的,需要能够捕捉自然数据重要属性的理论。线性回归已成为 ICL 理论的有用沙箱,但现有工作主要集中在独立示例的提示上。在这项工作中,我们将此设置扩展到顺序相关的数据,这是真实序列的基本特征。我们提出了一个基于线性注意力的可解模型,并在现实的 Transformer 架构上测试我们的预测。我们确定了两种不同的效果:首先,当查询标记独立于上下文时,上下文内相关性会产生有效的上下文长度:相关提示的行为就像较短的独立同分布。提示。其次,当查询也与其上下文相关时,测试误差会减少,特别是与线性注意力相比,对于 softmax 注意力而言。这些结果表明,相关提示不仅改变了上下文学习的有效样本量,而且还改变了与任务最匹配的注意力架构。