论文

经验漏斗:自我进化主体的状态—策略交替循环

Experience Funnel: A State-Policy Alternating Loop for Self-Evolving Agents

智能体系统Agent 架构与控制循环Agent Skills

摘要

由 大语言模型 (LLM) 驱动的自主代理通过交互不断积累经验,为通过自我进化改善未来行为创造机会。一个根本的挑战是如何将丰富的、特定于任务的交互经验转化为可重用的模型能力,而不牺牲快速适应新观察到的证据的能力。显式的文本状态,例如技能和代理工具,提供快速、人类可读和可编辑的适应,但会导致对外部上下文的持续依赖;参数策略提供紧凑且可重用的能力,但更新速度要慢得多。我们提出了\textit{Experience Funnel},一个自我演化的框架,它将快速的状态适应与缓慢的策略整合以交替循环的方式结合起来。交互轨迹首先被提炼成明确的文本状态,新获得的经验可以被快速合并和验证。然后,该框架有选择地识别在状态修订中仍然有用的状态启用行为,并通过转换感知 蒸馏 将其合并到策略中。更新后的状态—策略对随后产生了新的执行轨迹,为下一轮国家适应和策略整合提供了新的证据。跨不同代理基准的实验表明,与仅状态演化和策略内化方法相比,\textit{Experience Funnel}持续提高代理能力,同时逐步将有用的显式经验转化为自主策略能力。