论文
重新思考自我进化语言模型智能体的经验利用
Rethinking Experience Utilization in Self-Evolving Language Model Agents
摘要
自我进化代理通过积累和重用过去交互的经验来改进。现有的工作主要集中在如何构建、表示和更新经验,而很少关注在运行时决策过程中如何使用经验。因此,大多数代理依赖于严格的使用策略,要么在初始化时注入一次经验,要么在每一步注入经验,而不考虑当前决策是否需要它。本文研究了经验利用作为自我进化代理的关键设计维度。我们询问代理人是否会从经验使用与决策的交织中受益,以便仅在需要额外指导时才调用经验。为了研究这个问题,我们引入了 {ExpWeaver},这是一种轻量级实例化,它使经验构造保持不变,并通过在推理过程中将经验公开为可选资源来仅修改运行时利用率。在四个代表性框架、七个 LLM 主干和三种类型的环境中,ExpWeaver 在不同的利用策略中始终实现最佳性能。强化学习实验进一步表明,这种行为可以通过训练来放大。使用模式、因果消融和基于熵的分析表明,ExpWeaver 使代理能够在有益的决策点和更高的推理不确定性下选择性地调用经验。总的来说,我们的研究结果要求从仅仅研究要存储的\emph{什么}经验转向理解\emph{如何}和\emph{何时}经验应该进入决策。