论文

GAGPO:广义优势分组策略优化

GAGPO: Generalized Advantage Grouped Policy Optimization

模型训练强化学习

摘要

强化学习已成为 后训练 大语言模型 代理的强大范例,但多轮环境中的贡献分配仍然是一个挑战。智能体通常仅在情节结束时才会收到稀疏的轨迹级奖励,因此很难确定哪些中间操作导致了成功或失败。因此,在不依赖昂贵的辅助价值模型的情况下将延迟结果传播回各个决策步骤仍然是一个悬而未决的问题。我们提出了广义优势分组策略优化(GAGPO),这是一种无批评强化学习方法,用于精确、步骤对齐的时间贡献分配。 GAGPO 根据采样的展示构建非参数分组值代理,并使用它来计算 TD/GAE 式的时间优势,随着时间的推移递归地向后传播结果监督。结合分组优势归一化和动作级别重要性比,GAGPO 直接从多转弯轨迹中提取稳定的局部优化信号。 ALFWorld 和 WebShop 上的实验表明,GAGPO 的性能优于强大的强化学习基线。进一步的分析表明,早期学习速度更快,交互效率更高,优化动态更平滑,这表明 GAGPO 为多轮代理强化学习提供了一个简单而有效的框架。