论文

理解情境持续学习中的泛化和遗忘

Understanding Generalization and Forgetting in In-Context Continual Learning

模型评测模型行为与机制分析

摘要

情境学习 (ICL) 的强大之处在于,大语言模型 能够仅通过基于提示的推理来适应新任务,完全绕过参数更新的需要。现有理论主要研究单任务设置中的 ICL,而现实世界的提示通常包含异构任务序列,这在理解 大语言模型 是否在推理过程中隐式执行持续学习方面存在差距。为了弥补这一差距,我们提出了第一个上下文持续学习的理论框架,对预训练的 Transformer 如何通过共享注意力机制在单个提示内处理多个顺序任务进行建模。着眼于线性和屏蔽线性自注意力,我们推导了顺序任务提示下模型预测的误差表达式,并分析了它们的泛化和遗忘行为。我们的结果表明,标准注意力机制不可避免地会通过统一或因果地聚合历史背景来引起任务间干扰,从而导致系统偏差。我们进一步提供了预测误差的偏差-方差-干扰分解,描述历史上下文信息何时产生正迁移或可证明的负迁移。该分析揭示了基于注意力的连续推理的基本局限性,并为长提示中的顺序敏感性和性能下降提供了理论解释。