论文
TAPO:LLM 代理的转换感知策略优化
TAPO: Transition-Aware Policy Optimization for LLM Agents
摘要
最近,强化学习(RL)已成为 后训练 或 大语言模型(LLM)代理的重要范例。然而,现有的方法主要依赖于稀疏任务奖励来进行策略优化,未能充分利用在线交互过程中自然存在的另一类固有的密集监督信号:动作执行后的环境反馈。最近的理论研究表明,多步骤、目标导向的任务的泛化取决于对环境后果的预测知识。受此启发,我们提出了 TAPO:LLM Agents 的转换感知策略优化,这是一个在策略优化和转换监督之间交替的统一训练框架。除了标准 RL 更新之外,TAPO 还重新调整了采样轨迹数据的用途,以在共享骨干模型上应用以动作为条件的下一次观察预测监督。这种方法增强了模型对环境转变动态和行动后果的敏感性,同时优化了政策。它作为现有代理 RL 算法的计算轻量级、即插即用增强模块,不需要额外的专家数据、额外的采样成本或推理时间开销。我们在WebShop和ALFWorld上进行了系统的实验,将各种规模的基础模型与不同的策略优化算法相结合。实证结果表明,与纯策略优化基线相比,TAPO 持续提高了任务性能。