论文

Transformers 作为跨任务学习者:共享结构提高情境学习中的样本效率

Transformers as Cross-Task Learners: Shared Structure Drives Sample Efficiency in In-Context Learning

模型评测模型行为与机制分析

摘要

Transformers 通过在预训练期间共同学习广泛的任务系列并仅在简短的提示下适应看不见的任务来实现卓越的性能。然而,对这种现象的严格数学和统计理解仍然有限。本文旨在研究 Transformers 如何利用共享的跨任务结构以及该结构如何影响上下文学习(ICL)的样本复杂性。具体来说,我们通过覆盖规定指标下的数字来表征任务空间复杂性,从而量化低维跨任务结构,而不需要显式参数表示。由此产生的覆盖提供了一组锚函数,我们用它们来引入任务识别和评估过程:上下文观察在锚函数中定位看不见的任务,并且通过聚合相应的锚函数查询评估来预测查询的响应。为了近似,我们显式地构造一个具有 Softmax 注意力的 Transformer 来近似这个过程。为了泛化,我们得出一个误差界限,将预训练任务数量和提示长度的影响分开。预训练任务数量的缩放由任务空间和输入域的内在维度决定;一旦有足够多的任务可用,对提示上下文长度的依赖就变得无量纲了。据我们所知,这是第一个量化一般非线性任务族的跨任务复杂性并明确构建一个利用其低维结构来执行 ICL 的 Transformer 的工作。我们的理论提供了跨相关任务的联合预训练如何提高上下文泛化的定量解释。