论文
超越线性注意力:Softmax Transformer 实现上下文强化学习
Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning
摘要
上下文强化学习(ICRL)研究的智能体在预训练后,通过调节额外的上下文来适应新任务,而无需更新参数。现有的ICRL理论分析很大程度上依赖于线性注意力,它用恒等映射代替了标准注意力中的softmax函数。本文首次提供了对 ICRL 的理论理解,而没有进行不切实际的线性注意力简化。特别是,我们考虑实践中使用的标准 softmax 注意力。我们证明,在使用某些参数的情况下,具有这种 softmax 注意力的 Transformer 的分层前向传递相当于加权 softmax 时间差(TD)学习算法的迭代更新。这里,加权softmax TD是一种新的RL算法,它在内核空间中进行策略评估,并采用线性TD和表格TD作为特例。我们还证明,在一定的收缩条件下,策略评估误差随着层数的增加而衰减,并且使用上面确定的参数。最后,我们证明这些参数是预训练损失的全局最小化,解释了它们在我们的数值实验中的出现。