论文
表解码:DELTA 用于结构,TARQA 用于理解
Tables Decoded: DELTA for Structure, TARQA for Understanding
摘要
表格理解是文档智能的核心任务,包含两个关键子任务:表格重建和表格视觉问答(TabVQA)。虽然最近的方法主要依赖于在表格图像上运行的视觉语言模型(VLM),但我们提出了一种基于结构化文本表示的更具可扩展性和有效的替代方案。这些表示更容易处理,更自然地与大语言模型保持一致,并且无需特定于语言的视觉编码器,使它们特别适合多语言文档。我们推出了 DELTA,它将物理结构识别、逻辑结构识别和 OCR 分开,以准确地提取布局和内容。 DELTA 以优化表结构语言 (OTSL) 输出表格,这是一种紧凑且统一的格式,可对单元格排列和文本内容进行编码。在表结构识别 (TSR) 方面,DELTA 获得的 TEDS-Structure 分数可与 FinTabNet、PubTabNet 和 PubTables-1M 的最先进方法相媲美。我们通过我们策划的印地语基准 TORQUE 进一步建立了其在非英语表上的稳健性。在此基础上,我们引入了 TARQA,这是一种在 OTSL 序列上进行微调的大语言模型。我们的方法产生了 9.3 个百分点的收益。 WTQ (TabQA) 和 9.2 p.p.分别在 FinTabNetQA (TabVQA) 上。在 TORQUE 上,我们的方法在所有 VLM 和 DELTA + LLM 变体中排名第二。我们在以下位置发布代码、模型和基准测试:https://github.com/Tihiitborg/Tables-Decoded