论文
DenTab:用于对真实世界牙科评估进行表识别和视觉 QA 的数据集
DenTab: A Dataset for Table Recognition and Visual QA on Real-World Dental Estimates
摘要
表格将关键事务和管理信息压缩为紧凑的布局,但实际提取需要的不仅仅是文本识别:系统还必须恢复结构(行、列、合并单元格、标题)并解释常见捕获工件下的行项目、小计和总计等角色。许多用于表结构识别和 TableVQA 的现有资源都是从干净的数字源或渲染表构建的,因此仅部分反映了嘈杂的管理条件。我们引入了 DenTab,这是一个包含 2{,}000 个来自牙科评估的裁剪表格图像的数据集,具有高质量的 HTML 注释,可以在相同的输入上评估表格识别 (TR) 和表格视觉问答 (TableVQA)。 DenTab 包括 2{,}208 个问题,涉及 11 个类别,涵盖检索、聚合和逻辑/一致性检查。我们对 16 个系统进行了基准测试,包括 14 个视觉语言模型 (VLM) 和两个 OCR 基线。在各个模型中,强大的结构恢复并不能始终如一地转化为多步算术和一致性问题上的可靠性能,并且即使使用 真值 HTML 表输入,这些推理失败仍然存在。为了在无需训练的情况下提高算术可靠性,我们提出了表路由器管道,它将算术问题路由到确定性执行。该管道将 (i) 生成基线答案、结构化表表示和约束表程序的 VLM 与 (ii) 对解析表执行精确计算的基于规则的执行器相结合。源代码和数据集将在 https://github.com/hamdilaziz/DenTab 上公开。