论文
仅在需要时询问:主动检索经验驱动的终身代理的记忆和技能
Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents
摘要
在线终身学习代理不仅必须决定如何行动,还必须决定何时参考以前的经验,以不断改进长期任务。现有的方法通常被动地检索记忆,例如在任务初始化时或每个步骤之后,因此会错过交互过程中出现的知识差距。我们提出了 ProactAgent,这是一种经验驱动的终身学习框架,用于通过结构化经验库进行主动检索。 ProactAgent 通过 ExpOnEvo 不断改进,共同更新策略并完善记忆,将过去的交互组织到事实、情景和技能存储库中。它还进一步介绍了 ProactRL,它将检索视为明确的策略操作,并学习何时检索以及检索什么。通过比较具有和不具有检索的相同交互前缀的配对延续,ProactRL 提供了步骤级过程奖励,仅在提高任务结果或效率时才鼓励检索。 SciWorld、AlfWorld 和 StuLife 上的实验表明,ProactAgent 始终优于所有基准,成功率相对提高高达 32%,交互次数减少超过 33%。我们的代码将在 GitHub 上公开提供。