论文

长期语言智能体的里程碑引导策略学习

Milestone-Guided Policy Learning for Long-Horizon Language Agents

模型训练强化学习

摘要

虽然长期代理任务需要语言代理执行数十个连续决策,但通过强化学习来训练此类代理仍然具有挑战性。我们确定了两个根本原因:信用错误归因,即正确的早期行动因最终失败而受到惩罚;以及样本效率低下,即稀缺的成功轨迹导致学习信号几乎完全丢失。我们引入了一个里程碑引导的政策学习框架 BEACON,该框架利用长期任务的组成结构来确保精确的学分分配。 BEACON 在里程碑边界处划分轨迹,在分段内应用时间奖励塑造来信用部分进展,并在双尺度上估计优势,以防止远程失败破坏对本地行动的评估。在 ALFWorld、WebShop 和 ScienceWorld 上,BEACON 的表现始终优于 GRPO 和 GiGPO。值得注意的是,在长期 ALFWorld 任务中,BEACON 实现了 92.9% 的成功率,几乎是 GRPO 53.5% 的两倍,同时将有效样本利用率从 23.7% 提高到 82.0%。这些结果将里程碑锚定的学分分配确立为训练长视野语言智能体的有效范例。代码可在 https://github.com/ZJU-REAL/BEACON 获取。