论文

内核中的幽灵:通过领域泛化实现高效 Transformer 的情境学习

Ghost in the Kernel: In-Context Learning with Efficient Transformers via Domain Generalization

模型架构Transformer

摘要

基于 Transformer 的大型模型通过利用上下文感知注意力模块进行上下文学习,在不同任务中表现出了卓越的泛化能力。凭借更丰富的上下文,Transformer 可以更有效地适应当前用例,而无需任何参数更新。然而,与上下文长度相关的二次计算和内存复杂性显着减慢了 Softmax Transformer 中的数据处理速度。 Linear Transformer 被提出来通过降低对上下文长度的线性依赖的复杂性来解决这个问题,但从理论角度来看,线性注意力中特征映射的设计和理解仍然不清楚。在本文中,我们从域泛化的两阶段采样过程中研究了线性 Transformer 的近似和泛化能力。我们证明了线性 Transformer 执行上下文学习作为学习从上下文分布到响应函数的映射。我们的泛化分析获得了与维度无关的收敛率,这也展示了数据分布规律和潜在特征之间的权衡。在我们的理论框架的指导下,我们提出了线性化预训练 softmax 大语言模型 的激活和损失设计的新视角。