论文

从结果到行动:利用事后诸葛亮进行远景语言代理训练

From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training

模型训练强化学习

摘要

强化学习(RL)已成为一种广泛采用的技术,用于在复杂任务上改进 大语言模型(LLM)。尽管取得了这些进展,现有的强化学习方法在训练具有较长视野交互的智能体方面仍然面临挑战。一个主要瓶颈是区分长范围交互中不同动作的贡献,从而导致高优化方差。为了解决这个问题,我们引入了一种新颖的策略梯度方法,后见策略优化(HPO),它将当前策略分布和后见之明分布投影到意图空间中,并从它们之间的 Wasserstein 距离中提取低方差学习信号。我们从理论上和经验上表明,在意图空间中聚合语义上相似的状态和动作会产生有界方差估计量,并稳定地提高政策绩效。我们的代码可在线获取。