论文

CoEvoKG:知识图谱与自演化搜索Agent的协同演化

CoEvoKG: Co-Evolving Knowledge Graphs with Self-Evolving Search Agents

上下文与知识模型训练强化学习知识图谱记忆Agentic RLAgent记忆

摘要

大规模语言模型可以通过强化学习来改进搜索代理。然而,现有的自我学习代理在成功搜索后会重复生成任务,而丢弃了在成功搜索过程中获得的知识。我们提出CoEvoKG,这是一种将知识图谱转化为可验证训练任务和证据记忆的框架,用于代理进化。CoEvoKG同时训练任务生成器和搜索代理:任务生成器从知识图谱中采样实体链生成多跳问题,而代理则通过奖励机制学习答案正确性和搜索轨迹,这些轨迹由图证据支持。当搜索成功时,CoEvoKG验证并去重检索到的证据,然后将证据写回到相应的图节点和边。未来轮次使用此增强后的图进行任务生成和奖励计算,从而闭合模型自我进化和知识积累之间的循环。在六个QA基准(NQ、TriviaQA、PopQA、HotpotQA、2WikiMultiHopQA和Bamboogle)上的实验结果表明,CoEvoKG在Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct和Llama-3.1-8B-Instruct三个基础模型上,分别提高了11.2、10.1和11.6个点的宏观平均精度。在匹配的训练预算下,CoEvoKG进一步超越了竞争性的自我学习基准和强化学习基准,提高了搜索代理的宏观平均精度,分别增加了2.6到3.7个点。代码可在https://github.com/lazzy1225/CoEvoKG处获取。

CoEvoKG:知识图谱与自演化搜索Agent的协同演化:论文配图
图1 : CoEvoKG训练循环。多跳KG链提供可验证的任务模板和求解器证据的外部存储器。每次迭代,提议者都会从实体链中生成问题,求解器通过多回合搜索进行回答,并且当他们的实体路径得到图形证据的支持时,正确的轨迹会将经过验证的证据写回内存。