论文

SPARK:来自知识图谱的非对称奖励自博弈

SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs

模型训练强化学习RLVR

摘要

自对弈强化学习在具有形式可验证结构的领域(例如数学和编码)表现出了强大的性能,其中问题生成和奖励计算都可以基于明确的规则。将这种范式扩展到科学文献更具挑战性:文档内和跨文档的多模态元素之间的关系很少在文本中明确表达,这使得自动生成关系推理问题变得困难,并削弱了奖励信号的可靠性。我们提出了 SPARK(来自知识图谱的不对称奖励的自我游戏),这是一个从多文档科学文献中自动构建统一知识图谱(KG)的框架,并将其用作自我游戏的结构基础。多模态节点上的知识图谱路径作为生成关系推理问题的来源,存储在知识图谱中的结构化事实为可验证的奖励计算提供了基础。在信息不对称的情况下,单个小型视觉语言模型(sVLM)在提议者和求解者角色之间交替,并针对固定的知识图谱,我们相信这种设计可以在未来的工作中自然地扩展到在线适应。我们在公共基准和自行构建的跨文档多跳 QA 数据集上评估 SPARK。结果表明,SPARK 的性能始终优于基于扁平语料库的自对弈基线,并且随着跳数的增加,性能差距扩大,这表明 KG 结构基础对关系多跳推理的贡献超出了非结构化语料库基础所能提供的范围。

SPARK:来自知识图谱的非对称奖励自博弈:论文配图
图 1:SPARK 概述。三阶段管道自动从科学文档构建知识图谱,跨文档联合连接跨论文的概念节点。单个 sVLM 在 Proposer 和 Solver 角色之间交替:Proposer 从 KG 中采样推理路径,以生成具有黄金答案的关系问题,而 Solver 在信息不对称的情况下在没有 KG 访问权限的情况下进行回答。奖励信号分解为三个 KG 验证的组件,RanswerR_{\text{answer}}、RpathR_{\text{path}} 和 RconsistencyR_{\text{consistency}},其中 RpathR_{\text{path}} 和 RconsistencyR_{\text{consistency}} 是 SPARK 特有的术语,没有 KG 就无法定义。