论文
AEL:开放环境中不断发展的代理工具
AEL: Evolving Agent Harness in Open-Ended Environments
摘要
LLM AgentHarness是手工设计的并保持固定,因此Agent积累了经验,但从未学习如何使用它:检索哪些记忆,何时检索的证据具有误导性,以及何时检索策略本身应该改变。我们引入了代理进化学习(AEL),这是一个两个时间尺度的框架,可以进化工具,将内存使用重塑为在线策略选择。快速汤普森采样强盗在记忆检索策略中逐次选择,而慢速 LLM 反射则遵循先诊断后处方的原则:它首先解释性能下降的原因,然后在当前池稳定时注入有针对性的新检索策略作为强盗臂。 AEL 在顺序投资组合基准上优于 10 个自我改进和非 LLM 基线,与所有随机方法中方差最低的最强纯记忆变体相比,Sharpe 提高了 27%,并推广到支持票据路由流,与无反射汤普森采样相比,它的准确性提高了 18%,与最佳先前基线相比提高了 51%。机制研究进一步表明,收益是因果关系的:当政权要求不同的检索行为时,反思会准确地发挥作用,而当最佳政策稳定时,反思则被证明是无害/无收益的。代码和数据:https://github.com/WujianXu/AEL。