论文
SCPRM:面向知识图谱问答的模式感知累积过程奖励模型
SCPRM: A Schema-aware Cumulative Process Reward Model for Knowledge Graph Question Answering
摘要
大语言模型擅长复杂推理,但评估其中间步骤依然困难。过程奖励模型虽提供步级监督,却常受风险补偿效应困扰:错误步骤被后续正确步骤抵消,使有缺陷的推理路径获得高奖励。这一问题在知识图谱(KG)推理中进一步加剧——KG中起止实体间可能存在多条路径,一个高风险步即可污染整条推理路径。这在医疗、法律KG推理等风险敏感任务中问题突出。为此我们提出模式感知累积过程奖励模型(SCPRM):以推理前缀为条件评估推理路径,并纳入当前推理步与从查询解析出的隐式目标间的模式距离,提供累积与面向未来的奖励以引导路径探索。我们进一步把SCPRM集成进蒙特卡洛树搜索(MCTS),构成SCPRM-MCTS在KG上做问答多跳推理。在医疗与法律KGQA及CWQ上,SCPRM-MCTS较强基线平均提升Hits@k 1.18%,展示更准确、更风险敏感的推理评估。
