论文
学习适应:超越平稳性的情境学习
Learning to Adapt: In-Context Learning Beyond Stationarity
摘要
由于其强大的实证性能,Transformer 模型已成为广泛的科学和工程领域的基础。他们成功的关键能力是上下文学习(ICL):当收到来自未见过的任务的简短提示时,Transformer 可以执行每个标记和下一个标记的预测,而无需任何参数更新。最近的理论工作已经开始揭示这种现象背后的机制,特别是在监督回归设置中。然而,这些分析主要假设固定任务分布,忽略了目标函数随时间变化的一大类现实场景。在这项工作中,我们通过提供非平稳回归问题下 ICL 的理论分析来弥补这一差距。我们研究门控线性注意力(GLA)机制如何适应不断变化的输入输出关系,并严格表征其在这种动态环境中相对于标准线性注意力的优势。为了对非平稳性进行建模,我们采用一阶自回归过程,并表明 GLA 通过自适应调节过去输入的影响来实现较低的训练和测试误差——有效地实现可学习的新近度偏差。我们的理论发现得到了实证结果的进一步支持,验证了门控机制在非平稳 ICL 任务中的优势。