论文
DPEPO:基于 LLM 的代理的多样化并行探索策略优化
DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents
摘要
遵循顺序“推理然后行动”范式的 大语言模型 (LLM) 智能体在许多复杂任务中取得了卓越的性能。然而,这些方法的探索有限且环境理解不完整,因为它们每一步仅与单个环境交互。在本文中,我们首先介绍一种新颖的范例,使代理能够同时与多个环境交互并共享跨轨迹体验。在此范例的基础上,我们进一步提出了 DPEPO,一种强化学习(RL)算法,鼓励智能体执行多样化的并行探索。 DPEPO 有两个阶段:初始监督 微调 (SFT) 传授基本的并行推理和动作生成,然后是具有分层奖励方案的强化学习阶段。我们设计了一个并行的轨迹级成功奖励和两个步骤级奖励:多样化的行动奖励和多样化的状态转换奖励,它们积极惩罚行为冗余并促进广泛的探索。 ALFWorld 和 ScienceWorld 上的大量实验表明,DPEPO 实现了最先进的 (SOTA) 成功率,同时保持了与强顺序基线相当的效率。 (代码可在 https://github.com/LePanda026/Code-for-DPEPO 获取)