论文

AgentCL:迈向语言智能体持续学习的严格评估

AgentCL: Toward Rigorous Evaluation of Continual Learning in Language Agents

智能体系统Agent任务评测

摘要

语言智能体花费大量推理时间来解决单个任务,但在一个情节中获得的经验在未来的情节中往往没有得到充分利用。持续学习期望代理在一系列任务中积累可重用的经验,随着时间的推移不断改进,并避免不相关经验的干扰。不幸的是,现有的基准很难严格评估语言代理的持续学习。大多数工作都集中在长上下文对话或文档上的检索和推理,而最近的终身适应基准通常依赖于简单的任务流,对跨任务关系的分析有限,这使得很难理解代理随着时间的推移学习和重用什么。本文提出了一个用于代理持续学习的评估框架 AgentCL,以受控任务流和转移增益指标为中心。 AgentCL 构建组合流,其中早期的子解决方案、证据或工作流程可以在以后的任务中有意重用,并将它们与无法保证这种可重用性的朴素流进行对比。我们使用基准来评估用于持续学习的非参数内存设计。为了诊断内存设计选择如何影响持续学习,我们开发了 MemProbe,这是一种存储交互、见解和技能的探索方法,同时在巩固过程中过滤不可靠的体验。跨编码、深入研究和语言理解/推理任务的实证分析表明,朴素流区分内存设计的能力有限,而受控流则更清楚地区分其可塑性。与此同时,幼稚和保留的设置通常会产生有限的收益,并且可能会暴露内存引起的退化。这些结果凸显了需要更强大的内存设计来平衡可塑性和稳定的重用。

AgentCL:迈向语言智能体持续学习的严格评估:论文配图
图 1:任务流构建及其对评估的影响。组合关系是指一对任务,其中复杂的任务可以重用较简单的任务的解决方案。顺序关系是指任务执行的先后顺序。顶部:朴素流对来自同一域的任务进行排序,但不保证重用关系,而组合流将可重用的子任务放在相关的复杂任务之前。底部:CodeEval-Pro 和 BrowseComp+ 上评估方法的平均准确度箱线图,显示组合流比朴素流在内存重用方面产生更大的方法分离。