论文

Transformer 通过策略改进可证明实施情境强化学习

Transformers Provably Implement In-Context Reinforcement Learning with Policy Improvement

模型评测模型行为与机制分析

摘要

我们研究了 Transformer 执行上下文强化学习 (ICRL) 的能力,其中模型必须从轨迹数据推断并执行学习算法,而无需更新参数。我们证明,线性自注意力 Transformer 块可以通过显式参数构造来证明实现策略改进方法,包括半梯度 SARSA 和 actor-critic。除了存在性之外,我们设计了一个模仿教师的训练过程,分析了其梯度流动力学,并在 ICRL 文献中建立了第一个收敛保证:在训练 MDP 分布的适当丰富度条件下,梯度流局部且指数地收敛到与所需 RL 更新相对应的最佳参数流形。根据经验,在随机生成的表格 MDP 上训练 Transformer 证实了这些预测:学习的模型恢复了我们显式构造的参数结构,并且当部署在看不见的 MDP 上时,提供强大的上下文控制性能。这些结果共同阐明了 Transformer 架构如何在上下文中内化和执行经典强化学习算法,从而在 ICRL 中架起机械理解和训练动态的桥梁。