论文

StraTA:通过战略轨迹抽象激励代理强化学习

StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction

模型训练强化学习

摘要

大语言模型 (LLM) 越来越多地用作交互式代理,但优化它们以进行长期决策仍然很困难,因为当前的方法很大程度上纯粹是反应性的,这削弱了扩展轨迹上的探索和贡献分配。在这项工作中,我们提出了策略轨迹抽象(StraTA),这是一个简单的框架,它将显式轨迹级策略引入代理强化学习(RL)中。 StraTA 从初始任务状态中采样紧凑策略,根据该策略调整后续操作,并与分层 GRPO 式采样轨迹设计联合训练策略生成和操作执行,并通过多样化策略采样轨迹和关键自我判断进一步增强。 ALFWorld、WebShop 和 SciWorld 上的实验表明,与强大的基线相比,StraTA 持续提高了样本效率和最终性能。 StraTA 在 ALFWorld 上的成功率达到 93.1%,在 WebShop 上的成功率达到 84.2%。在 SciWorld 上,StraTA 获得了 63.5% 的总分,优于前沿闭源模型。