论文

TABVERSE:LLM与VLM跨格式表格理解基准

TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs

模型评测基准与评测资源

摘要

大型语言模型(LLM)和视觉语言模型(VLM)越来越多地在表推理任务上进行评估,但表表示的作用仍然未被充分探索。在实践中,相同的表格内容可能会以不同的结构格式(例如 HTML、Markdown 和 LaTeX)或渲染图像出现。然而,现有的评估往往让内容、格式、布局和模态一起变化,使得很难隔离表征效果。我们引入了 TABVERSE,这是一种受控的多模态表格基准测试,它可以跨多种结构格式和渲染图像对齐相同的表格内容,并带有问题类别和难度标签。这种设计可以在保持表格内容固定的同时系统地评估表示效果。我们通过三个任务评估大语言模型和 VLM:问答 (QA)、结构理解能力 (SUC) 和结构重建 (SR)。我们的结果表明,表示形式的选择极大地影响了表格的理解。模型在结构化文本上的表现通常比在渲染图像上的表现更好,但这种差距的大小取决于任务、模型和格式。 HTML 通常是最强大的文本格式,而行敏感的结构任务和语法上可用的 LaTeX 重建仍然具有挑战性。这些发现表明,表格表示是可靠表格评估的关键因素。

TABVERSE:LLM与VLM跨格式表格理解基准:论文配图
图 1:TabVerse 概述:从平衡的评估集中,每个表都以三种结构格式(HTML、Markdown、LaTeX)表示,并具有相应的渲染图像。这些对齐的多模态对可以跨 VLM 和 LLM 对 QA、SUC 和 SR 任务进行评估,以进行跨格式和跨模态分析。