论文

超越表格:用于相对忠实的文档到数据库构建的 Doc2DB-Bench

Beyond Tables: Doc2DB-Bench for Relationally Faithful Document-to-Database Construction

模型评测基准与评测资源

摘要

实用的人工智能系统越来越需要将冗长的异构文档转换为可查询的关系数据库,而不是孤立的电子表格。在金融、医疗保健、教育、交通和企业运营等领域,下游工作流依赖于规范化模式、实体身份、密钥、跨表关系和完整性约束来进行分析、合规性、审计和 SQL 支持的决策。现有的文档到表基准不足以满足此设置:将证据平铺到单个表中可能会重复实体、模糊多对多关系、创建稀疏记录,并避免测试提取的事实是否形成有效的数据库实例。这就迫切需要将文档理解评估为数据库构建而不是字段提取。我们引入了 Doc2DB-Bench,这是文档到数据库构建的基准,包含跨 42 个模式和 7 个域组的 203 个长文档实例,其中包括 117 个实体表、132 个关系表、7,341 行和 41,935 个单元。通过可控的 DB-to-Doc 合成管道构建,并通过表内提取和表间推理的分类法进行组织,生成的文档经过真实性验证,证明与现实世界的参考没有区别。因此,Doc2DB-Bench 为基于 LLM 的可靠、可审计且关系可靠的数据系统提供了一个测试平台。该基准测试可在 https://github.com/SetonLiang/Doc2DB-Bench 上公开获取。