论文

GAPD:知识库问答中代理强化学习的黄金行动政策 蒸馏

GAPD: Gold-Action Policy Distillation for Agentic Reinforcement Learning in Knowledge Base Question Answering

模型训练奖励建模与过程监督

摘要

强化学习 (RL) 非常适合代理知识库问答 (KBQA),其中模型必须发出可执行操作、观察知识库反馈并最终返回答案。然而,当前基于强化学习的 KBQA 系统主要优化最终答案的稀疏奖励,而对中间动作错误的监督很弱。这对于逻辑形式注释的 KBQA 基准尤其有限制:黄金逻辑形式可以转换为可执行的操作序列,但现有管道主要将它们用于热启动数据构造,而不是用于 同策略 RL 更新。我们提出 GAPD,一种训练时黄金行动政策 蒸馏 框架,为基于结果的强化学习添加了密集的 词元级 指导。为了使黄金行动与 同策略 学生轨迹采样保持一致,GAPD 使用中锚匹配:它将学生探索和黄金执行过程中达到的中间实体视为状态锚,并通过这些探索的实体集将学生状态与黄金状态进行匹配。以这种对齐的黄金行动为条件的当前政策充当停止梯度教师,其词元分布在生成的行动词元跨度上被提炼回普通学生政策。 GAPD 始终超越 WebQSP、GrailQA 和 GraphQ 的当前技术水平。