论文
AgentKGV:用于知识图事实验证的两阶段训练的 Agentic LLM-RAG 框架
AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphs
摘要
知识图(KG)通常是从大规模语料库自动构建的,但由于噪声源和提取失败,它们不可避免地包含事实错误,在工业规模上可靠地验证它们仍然是一个关键挑战。为了解决这个问题,我们提出了 AgentKGV,即用于 KG 事实验证的 Agentic LLM-RAG 框架,它集成了动态路由和迭代查询重写,可处理文档级检索中的表面形式不匹配。为了使该框架在工业部署中更加准确和更具成本效益,我们进一步引入了两阶段训练策略:基于蒸馏的轮级SFT,将推理能力从大型教师模型转移到小模型中,以进行稳定的查询重写和推理;轨迹级GRPO,优化搜索策略以减少大规模不必要的检索。在开放域 T-REx 基准的长尾谓词分割上,我们的框架将宏 F1 比单轮 RAG 提高了 5.5 \%p,两阶段训练将其进一步提高了 9.4 \%p。 GRPO 还将平均搜索调用次数从 3.24 次减少到 1.63 次,而准确率却没有降低。