论文
TIGPO:长期 LLM 代理的时态实例图策略优化
TIGPO: Temporal Instance-Graph Policy Optimization for Long-Horizon LLM Agents
摘要
基于图的策略优化通过将轨迹采样轨迹组织成状态转换图来改善长视野 LLM 代理的信用分配。然而,现有的方法在每次策略更新中独立构建图,丢弃早期策略发现的转换,并将优势估计限制在小型、批量本地轨迹采样组中。我们提出\emph{时间实例图策略优化}(TIGPO),它将基于图的信用分配扩展到策略更新之间。 TIGPO 为每个任务维护一个持久的转换图,允许不同策略版本发现的有效转换共同确定当前采样轨迹的信用。为了积极地将当前探索与历史经验重新连接起来,TIGPO 在用于普通任务采样的探索时段和用于延迟重新尝试先前探索的任务的重新访问时段之间分配固定的轨迹采样预算。对于每次重访,TIGPO 将当前的轨迹采样组与其相应的早期探索组配对,以构建跨时间参考。扩大的参考旨在稳定小轨迹采样组下的相对优势估计,而对同一任务的比较可以直接捕获跨训练阶段的策略改进。历史转变和分数仅作为结构性和独立的统计参考,并且永远不会在策略损失中重播。 ALFWorld 和 WebShop 上的实验表明,TIGPO 始终优于先前基于组和基于图的策略优化方法。