论文

MileGPO:使用本地证据进行里程碑推断,用于长视野 LLM 代理的基于图的策略优化

MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents

模型训练强化学习

摘要

在长期代理强化学习中,学分分配具有挑战性,其中监督通常仅来自最终奖励。现有方法通过步骤分组或基于图形的优势估计将轨迹级信号细化为步骤级信用,但可能忽略有意义的中间里程碑。我们提出了 MileGPO(基于图的策略优化的具有本地证据的里程碑推理),它通过三种设计从分组的 同策略采样轨迹中获得流程级信用。里程碑发现识别成功执行轨迹的候选里程碑和失败的重复陷阱。可靠性校准塑造(RCS)通过基于结果的信心对这些候选者进行加权,加强可靠的里程碑和陷阱,同时降低不确定的权重。进度对比校准(PCC)进一步测试候选者是否反映了本地进度以及其即将到来的转换是否优于来自同一状态的观察到的替代方案。 MileGPO 既不需要辅助模型,也不需要额外的环境交互。 ALFWorld 和 WebShop 上的实验显示了 ALFWorld 上最先进的性能以及较小的分布内与分布外差距。消融和信用诊断表明,可靠性加权、本地进展和同状态分支证据补充了里程碑发现并解决了模糊的中间信用。