论文

Knowledge Weaver:通过互信息反馈学习积累知识

Learning to Accumulate Knowledge with Mutual Information

模型训练上下文与知识强化学习记忆Agent记忆Agentic RL

摘要

大型语言模型(LLM)Agent可以通过重用从过去的交互中提取的知识来提高其性能。然而,将新的经验融入到知识库中,使其随着知识库的增长而变得更加有用,仍然具有挑战性。有效的知识积累应该限制条目之间的冗余重叠,并确保新知识的贡献超出银行已经提供的知识。然而,通过组相对策略优化 (GRPO) 对管理者进行关于独立任务成功的培训可以加强一般指导,即使它重复了现有知识。因此,我们提出了 Knowledge Weaver,这是一个强化学习框架,用于训练语言模型以从Agent轨迹中管理可重用的知识。我们将受Token互信息(MI)启发的反馈与边际成功奖励结合起来,以指导知识积累。这些信号共同鼓励策展人保留来自经验的独特信息,并生成在添加到现有知识中时提高任务成功率的条目。独立的成功奖励也有利于本身有用的条目。在 ALFWorld 和 WebShop 上,Knowledge Weaver 在检索到 k=10 条条目时取得了 54.0% 和 42.0% 的平均成功率,分别比 GRPO 高出 16.9 和 18.7 个百分点。其知识库在 ALFWorld 总体成功率和冻结执行者的 WebShop 评分方面也优于评估的基于提示的成熟银行(包括人工编写的银行)。我们的代码库可在 https://github.com/LaoKuiZe/Knowledge-Weaver。 获取

Knowledge Weaver:通过互信息反馈学习积累知识:论文原图
图 2:Knowledge Weaver 概述。Token级别的 MI 反馈促进了依赖于经验的知识,而执行奖励则评估了个人效用和检索到的知识的边际收益。只有策展人接受了培训,而执行人则保持冻结状态。