论文

情境强化学习与思想链的融合与出现

Convergence and Emergence of In-Context Reinforcement Learning with Chain of Thought

模型评测模型行为与机制分析

摘要

上下文强化学习 (ICRL) 是指 RL 智能体在推理时适应新任务的能力,无需通过附加上下文进行条件更新而进行参数更新。最近的实证研究进一步表明,思想链 (CoT) 的生成可以放大这种 ICRL 能力。本文首次对 CoT 如何与 ICRL 相互作用提供了理论理解。我们在具有线性 Transformer 的策略评估设置中进行分析。我们证明,使用特定的 Transformer 参数,CoT 生成过程相当于重复执行时间差异学习更新。此外,我们提供的有限样本收敛分析表明,策略评估误差随着 CoT 长度呈几何下降,并最终在由上下文长度确定的统计下限处饱和。我们还证明了所需的 Transformer 参数是预训练损失的全局最小化,为这些参数的经验出现提供了理论理解。