论文
知识图谱路径作为自进化搜索智能体的中间监督
Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents
摘要
自我进化的搜索代理通过生成和解决自己的搜索任务来减少对人类编写的训练问题的依赖。我们以搜索自我对弈(SSP)为基础,这是一种代表性的提议者和求解器框架,其中通过多步骤搜索和推理生成和回答问题。然而,在实践中,SSP 面临两个瓶颈:提议者从没有关系上下文的孤立答案实体构建问题,在早期自我对弈训练中产生许多无效或无法验证的问题,而求解器仅收到二元结果奖励,丢弃来自部分正轨搜索轨迹的有用信号。我们通过重用知识图路径作为问题构建和奖励塑造的构建衍生中间监督来解决这两个瓶颈。首先,我们在LLM指导的知识图子图中构建问题,为提案者提供关系上下文。其次,我们观察到构建和解决多跳问题可能涉及重叠的中间实体:用于制定问题的事实桥梁可能会提供用于回答问题的近似路径点。利用这种重叠,我们引入了路点覆盖奖励(WCR),它根据不正确的求解器轨迹对构建路径上实体的覆盖程度给予部分评分,同时保留对正确答案的全额奖励。在七个 QA 基准和九个模型配置中,我们的方法在所有配置中都提高了标准 SSP 的平均分数,包括在多跳 QA 任务上的显着收益。这些结果表明,知识图路径可以作为轻量级中间监督重用,提供关系指导和流程反馈,而无需额外的特定于任务的人工注释或手动标记的流程步骤。
