论文
APEX:自我进化LLM代理的自治策略探索
APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents
摘要
LLM 代理在各种复杂任务中表现出了强大的性能,包括需要长期决策的交互式环境。但这些智能体无法在测试时即时学习。自我进化代理通过积累不同事件的记忆和反思来解决这个问题,而不是需要模型权重更新。然而,这些智能体经常遭受探索崩溃的困扰:随着记忆的增长,行为集中在熟悉的高回报例程上,从而减少了发现更好替代方案的机会。为了解决这个问题,我们提出了自主策略探索(APEX),它通过策略图(具有先决依赖边的里程碑的有向无环图)构建和维护显式策略空间。在 APEX 中,Fork Discovery 通过基于证据的未探索方向扩展了地图,而 Policy Selection 在规划过程中平衡了探索和利用。在九款 Jericho 文本冒险游戏和 WebArena(现实的网络交互基准)上进行评估后,APEX 的表现优于所有基准。广泛的消融验证了每个组件的贡献,并证明了在不同环境下的稳健性,证明了 APEX 对于自我进化代理的持续探索的有效性。