论文

从诊断到纠正:基准测试和改进现实世界表解析

From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing

智能体系统Agent 架构与控制循环

摘要

最近的文档解析器在 OmniDocBench v1.6 上获得了 93 以上的表 TEDS 分数,但社区反馈和我们的审计揭示了复杂的现实世界表上持续存在的故障。为了量化这一差距,我们引入了 TableParseMap,这是一个由 916 个现实世界表组成的诊断基准,这些表被组织成五个具有挑战性的场景和九种故障类型。评估最强的解析器仅获得 85.03 TEDS,这表明基准测试总分掩盖了重大弱点。我们的分析将这些失败归因于三个互补的限制:大表格超出了单次传递的可靠处理规模,弱或模糊的视觉线索阻碍了结构感知,并且重建的表格可能在视觉上与图像不一致。因此,我们提出 DEC(分解--增强--正确),这是一种视觉一致性引导的代理框架,无需重新训练即可改进冻结表解析器。 DEC 使用通用 VLM 作为控制器:沿着结构感知边界分解大型表,增强暴露弱视觉证据并重新分析转换后的视图,以及正确诊断和修复残留错误。视觉一致性门 (VC-Gate) 选择性地触发干预,而视觉一致性排序器 (VC-Ranker) 验证候选更新并支持在推理时无需 真值 HTML 的回滚。我们通过离线指标和跨模型共识,进一步从 4,556 个候选者中得出 1,977 个表的共识硬集。在三个冻结解析器中,DEC 平均将 TEDS 提高了 1.57 个点;在 TableParseMap 上,整体提升达到 1.89 分,结构错误提升 2.62 分,大型表提升 5.66 分。