论文
CoEvoKG:知识图谱与自演化搜索Agent的协同演化
CoEvoKG: Co-Evolving Knowledge Graphs with Self-Evolving Search Agents
摘要
大规模语言模型可以通过强化学习来改进搜索代理。然而,现有的自我学习代理在成功搜索后会重复生成任务,而丢弃了在成功搜索过程中获得的知识。我们提出CoEvoKG,这是一种将知识图谱转化为可验证训练任务和证据记忆的框架,用于代理进化。CoEvoKG同时训练任务生成器和搜索代理:任务生成器从知识图谱中采样实体链生成多跳问题,而代理则通过奖励机制学习答案正确性和搜索轨迹,这些轨迹由图证据支持。当搜索成功时,CoEvoKG验证并去重检索到的证据,然后将证据写回到相应的图节点和边。未来轮次使用此增强后的图进行任务生成和奖励计算,从而闭合模型自我进化和知识积累之间的循环。在六个QA基准(NQ、TriviaQA、PopQA、HotpotQA、2WikiMultiHopQA和Bamboogle)上的实验结果表明,CoEvoKG在Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct和Llama-3.1-8B-Instruct三个基础模型上,分别提高了11.2、10.1和11.6个点的宏观平均精度。在匹配的训练预算下,CoEvoKG进一步超越了竞争性的自我学习基准和强化学习基准,提高了搜索代理的宏观平均精度,分别增加了2.6到3.7个点。代码可在https://github.com/lazzy1225/CoEvoKG处获取。
