APEX-EM:通过结构化程序情景经验回放进行自主代理的非参数在线学习
APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay
摘要
LLM 代理对每项任务重新运行完整推理,即使是他们之前解决的任务。我们引入了 \textbf{APEX-EM},一种非参数经验存储器,它将完整的程序情景跟踪存储在类型化的程序知识图(PKG)中,并通过三个渠道检索它们:语义搜索、抽象操作序列上的结构签名匹配和图遍历。计划-检索-生成-迭代-摄取 (PRGII) 工作流程生成、质量门控并提交经验,对成功和失败进行索引,以便代理了解要重用哪些内容以及要避免哪些内容。部署期间权重不变。我们评估五个基准:BigCodeBench、KGQAGen-10k、HLE、Lifelong Agent Bench 和 ALFWorld。由于之前的工作使用不同的主干网,因此我们的主张基于保持模型功能固定的相同主干网比较。在使用共享 GPT-4o 主干的 BigCodeBench 传输中,APEX-EM 在无内存基线上获得了 +7.6\,pp,在相同设置下获得了 $3.3\times$ MemRL 的 +2.3\,pp。在具有共享 GPT-4o-mini 主干的 Lifelong Agent Bench 上,它获得了 +1.4\,pp (OS) 和 +1.0\,pp (DB) 累积成功。在 KGQAGen-10k 上,冻结记忆转移到盲 1{,}079 个问题测试,分裂率为 73.7\%,而没有记忆则为 42.0\%,接近预言机交给的 真值 子图 (84.9\%)。在三个 Opus 比例中,内存增益保持在 +27 到 +32\,pp,因此它增加了模型功能,而不是取代它。组件分析显示,没有单一机制占主导地位:教师反馈对于代码来说可以忽略不计,但在结构化查询上增加了+10.3\,pp,结构签名给纯语义检索的传输带来了$3.3\times$,并且当丰富的反馈不可用时,内时代迭代恢复了大部分增益。这些结果支持每个域组成的模块化内存。