论文

DeepRefine:通过强化学习进行代理知识细化

DeepRefine: Agentic Knowledge Refinement via Reinforcement Learning

上下文与知识知识获取与更新

摘要

外部知识使 大语言模型 (LLM) 代理能够在开放式知识密集型下游任务中将其行动和决策置于内在参数记忆之外。然而,基础知识库的质量受到不完整、不正确或冗余的系统性限制,表现为证据缺失或跨文档链接、置信度低或不精确的主张以及模糊或共指解决问题。这些缺陷在迭代使用下会加剧,降低检索保真度和下游任务性能。我们提出了 \textbf{DeepRefine},这是一种用于代理知识细化的强化学习框架,它可以提高任何预先构建的结构化知识库(例如知识图或 LLM-Wiki)的质量,并通过用户查询使其更适合下游任务。 DeepRefine 与知识库进行多轮交互,并对交互历史进行溯因诊断,定位可能的缺陷,并执行有针对性的细化操作以增量知识库更新。为了在没有黄金细化轨迹的情况下进一步优化 DeepRefine 的细化策略,我们引入了 Gain-Beyond-Draft (GBD) 奖励,并通过强化学习端到端地训练推理过程。广泛的实验表明下游在强基线上获得了一致的收益。