论文
连续的潜在上下文使 Transformer 中的高效在线学习成为可能
Continuous Latent Contexts Enable Efficient Online Learning in Transformers
摘要
大语言模型 (LLM) 表现出强大的上下文学习能力:给定标记的示例,它们可以在不更新参数的情况下生成良好的预测。然而,许多交互式设置超出了静态预测到在线决策的范围,其中有效的行为需要在长时间的多回合范围内适应反馈,并且这些领域中的有效算法必须使用它们所学到的内容的紧凑表示。最近,具有潜在思想链的连续 Transformer 架构已显示出对离线迭代任务(例如有向图可达性)的希望。受此启发,我们研究连续潜在上下文标记是否能够使 Transformer 更有效地实现在线学习。我们给出了恒定深度 Transformer 的显式构造,它通过使用少量潜在上下文标记将算法状态存储为特征嵌入的线性组合来实现两个基本的在线决策程序(加权多数算法和 $Q$ 学习)。我们使用不直接监督潜在状态的多课程目标进一步训练具有潜在上下文的小型 GPT-2 式 Transformer。在长合成在线预测序列上,该模型优于更大、更复杂的 LLM,包括 Qwen-3-14B 和 DeepSeek-V3。我们的结果表明,连续的潜在上下文为 Transformer 提供简单有效的持久状态来实现在线学习算法。