论文

Transformer 情境学习能力研究

Investigation into In-Context Learning Capabilities of Transformers

模型评测模型行为与机制分析

摘要

Transformer 展示了强大的上下文学习 (ICL) 能力,使模型能够仅使用推理时提供的示例输入输出对来解决以前未见过的任务。虽然先前的理论工作已经建立了 Transformer 可以在上下文中执行线性分类的条件,但控制该机制成功时的经验缩放行为仍然没有充分表征。在本文中,我们对高斯混合二元分类任务的上下文学习进行了系统的实证研究。基于 Frei 和 Vardi (2024) 的理论框架,我们分析了上下文测试准确性如​​何取决于三个基本因素:输入维度、上下文示例数量和 预训练 任务数量。使用受控的合成设置和线性上下文分类器公式,我们隔离了模型仅从上下文成功推断任务结构的几何条件。我们还研究了良性过度拟合的出现,其中模型会记住上下文中的噪声标签,同时仍然在干净的测试数据上实现强大的泛化性能。通过对维度、序列长度、任务多样性和信噪比的广泛扫描,我们确定了出现这种现象的参数区域,并描述了它如何依赖于数据几何和训练暴露。我们的结果提供了上下文分类中缩放行为的全面经验图,强调了维度、信号强度和上下文信息在确定上下文学习何时成功和何时失败方面的关键作用。