论文
情境强化学习与思想链的融合与出现
Convergence and Emergence of In-Context Reinforcement Learning with Chain of Thought
摘要
上下文强化学习 (ICRL) 是指 RL 智能体在推理时适应新任务的能力,无需通过附加上下文进行条件更新而进行参数更新。最近的实证研究进一步表明,思想链 (CoT) 的生成可以放大这种 ICRL 能力。本文首次对 CoT 如何与 ICRL 相互作用提供了理论理解。我们在具有线性 Transformer 的策略评估设置中进行分析。我们证明,使用特定的 Transformer 参数,CoT 生成过程相当于重复执行时间差异学习更新。此外,我们提供的有限样本收敛分析表明,策略评估误差随着 CoT 长度呈几何下降,并最终在由上下文长度确定的统计下限处饱和。我们还证明了所需的 Transformer 参数是预训练损失的全局最小化,为这些参数的经验出现提供了理论理解。