论文
作为隐式策略梯度的情境学习
In-Context Learning as Implicit Policy Gradient
摘要
最近的工作表明,大语言模型 (LLM) 可以通过将生成的样本及其相应的评估分数合并为上下文示例来迭代地改进其输出。尽管有这些实证研究结果,但这种现象背后的理论基础仍然知之甚少。在本文中,我们表明分数条件上下文学习(ICL)承认与策略梯度优化的结构对应。我们首先提供了一个建设性的证明,证明自注意力机制可以在特定的权重矩阵配置下实现类似于 REINFORCE 算法的奖励加权聚合,并讨论这种构造与预训练的 Transformer 的行为之间的关系。该对应关系在隐藏状态空间中是有方向的,并且仅在规定的简化条件下才准确成立;我们根据经验量化其强度。在我们简化的隐藏状态模型中,我们进一步推导出由有限注意力更新引起的分布变化的精确上限,从而产生与 KL 约束策略优化类似的信任区域类比。我们通过多个 LLM 的广泛实验验证了我们的理论,证明 LLM 有效地利用分数信息将输出分布转向高分样本,并且注意力权重与样本分数表现出很强的相关性。