论文

DAGverse:从科学论文构建文档依据对齐的语义DAG

DAGverse: Building Document-Grounded Semantic DAGs from Scientific Papers

模型评测基准与评测资源

摘要

有向无环图(DAG)被广泛用于表示科学技术领域的结构化知识。然而,真实世界DAG的数据集仍然稀缺,因为构建它们通常需要专家对领域文档进行解读。我们研究Doc2SemDAG构建问题:从文档中恢复一个首选的语义DAG,同时给出解释它的被引证据与上下文。这一问题具有挑战性,因为一份文档可能允许多种合理的抽象,预期结构往往是隐式的,且支持证据散落在正文、公式、图注和插图之中。为应对这些挑战,我们利用包含显式DAG图示的科学论文作为天然监督来源。在这种设定下,DAG图示提供DAG结构,而随附文本提供上下文与解释。我们提出DAGverse,一个从在线科学论文构建以文档为依据的语义DAG的框架。其核心组件DAGverse-Pipeline是一个半自动系统,旨在通过图示分类、图重建、语义关联和验证来产出高精度语义DAG样本。作为案例研究,我们在因果DAG上测试该框架,并发布DAGverse-1——一个包含108个经专家验证的语义DAG、且附有图级、节点级和边级证据的数据集。实验表明,DAGverse-Pipeline在DAG分类与标注上优于现有视觉语言模型。DAGverse为以文档为依据的的DAG基准奠定了基础,并为研究基于真实世界证据的结构化推理开辟了新方向。

DAGverse:从科学论文构建文档接地的语义DAG:论文配图
图1:从一篇科学论文构建文档锚定语义DAG的流程示意(构造细节见附录0.A)。