论文

统计表格知识图谱构建中的格式—约束耦合

Format-Constraint Coupling in Knowledge Graph Construction from Statistical Tables

模型评测基准与评测资源

摘要

抽取schema本不应降低知识图谱保真度,但在统计CSV上它却可能如此。我们研究按国家-年份组织的时间序列矩阵,这是开放数据门户上常见的一种表布局。在这一设定中,序列化格式与schema约束呈超加性交互:其联合效应超出独立效应之和最多达+1.180(2×2析因实验,6个数据集)。在6个数据集中的4个上,Bootstrap 95%置信区间严格为正,其中宽型Type-II矩阵上的证据最强。更关键的是,将schema应用于不匹配的格式可能触发灾难性失配:由于实体膨胀或抽取拒绝,6个数据集中有4个的事实覆盖率跌破无约束基线。我们将这一观察到的模式称为格式—约束耦合。探测实验与token消融支持一种以列名引用为中心的表层形式锚定解释。横跨格式—schema配对、GraphRAG宿主与LLM家族的受控变体在测量范围内呈现相同方向;其中一个LLM家族仅表现出部分激活。这一观察还有一个诊断层面的推论:三种标准检索模式在很大程度上掩盖了构建质量差异(delta ≤ 1pp),而直接访问图谱可暴露高达+47.6pp的差距(p < 0.0001)。为支持保真度感知的评估,我们发布CSVFidelity-Bench,其中包含15个数据集、11个Type-II矩阵、4个Type-III表格,以及横跨6个领域的1,892条Gold Standard事实。

统计表格知识图谱构建中的格式—约束耦合:论文配图
图1:面向统计CSV的SGE三阶段处理框架总览,用于从统计表格中构建知识图谱。