论文
证据单元:基于本体的文档组织,用于独立于解析器的检索
Evidence Units: Ontology-Grounded Document Organization for Parser-Independent Retrieval
摘要
结构化文档——与说明配对的表格、带有解释的图表、带有解释它们的段落的方程——在索引检索时通常会变得支离破碎。元素级索引将每个解析的元素视为一个独立的块,将语义内聚的单元分散在单独的检索候选中。本文提出了一个独立于解析器的管道,用于构造证据单元(EU):语义完整的文档块,将视觉资产与其上下文文本分组。我们介绍了四个贡献:(1)基于本体的角色规范化扩展了 DoCO,将异构解析器输出映射到统一的语义模式; (2) 语义全局分配算法,通过完整的相似度矩阵将段落最佳地分配给 EU; (3) Neo4j 中基于图的决策层,它形式化了 EU 构造规则并通过两个不变量验证完整性; (4) 交叉解析器验证显示 EU 空间足迹在 MinerU 和 Doclling 上收敛,并在解析器引起的 bbox 方差下保留了增益。 OmniDocBench v1.0(1,340 页;1,551 个 QA 对)上的实验表明,基于 EU 的分块将检索 LCS 提高了 +0.31(0.50 至 0.81)。 Recall@1 从 0.15 增加到 0.51 (3.4 倍),MinK 从 2.58 减少到 1.72。跨解析器结果确认增益(LCS +0.23 至 +0.31)在解析器之间得以保留。文本查询显示出最显着的增益:Recall@1 从 0.08 上升到 0.47。