论文
AgentCL:迈向语言智能体持续学习的严格评估
AgentCL: Toward Rigorous Evaluation of Continual Learning in Language Agents
摘要
语言智能体花费大量推理时间来解决单个任务,但在一个情节中获得的经验在未来的情节中往往没有得到充分利用。持续学习期望代理在一系列任务中积累可重用的经验,随着时间的推移不断改进,并避免不相关经验的干扰。不幸的是,现有的基准很难严格评估语言代理的持续学习。大多数工作都集中在长上下文对话或文档上的检索和推理,而最近的终身适应基准通常依赖于简单的任务流,对跨任务关系的分析有限,这使得很难理解代理随着时间的推移学习和重用什么。本文提出了一个用于代理持续学习的评估框架 AgentCL,以受控任务流和转移增益指标为中心。 AgentCL 构建组合流,其中早期的子解决方案、证据或工作流程可以在以后的任务中有意重用,并将它们与无法保证这种可重用性的朴素流进行对比。我们使用基准来评估用于持续学习的非参数内存设计。为了诊断内存设计选择如何影响持续学习,我们开发了 MemProbe,这是一种存储交互、见解和技能的探索方法,同时在巩固过程中过滤不可靠的体验。跨编码、深入研究和语言理解/推理任务的实证分析表明,朴素流区分内存设计的能力有限,而受控流则更清楚地区分其可塑性。与此同时,幼稚和保留的设置通常会产生有限的收益,并且可能会暴露内存引起的退化。这些结果凸显了需要更强大的内存设计来平衡可塑性和稳定的重用。
