论文

TableVision:面向复杂层级表格空间定位推理的大规模基准

TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables

模型评测基准与评测资源

摘要

结构化表格是金融、医疗与科学研究等专业领域传达高密度信息的关键载体。尽管多模态大语言模型(MLLM)不断进步,其在具有层级布局的复杂表格上的推理性能仍然有限。本文通过定量分析识别出一个关键的感知瓶颈。我们发现,随着任务复杂度提升,所涉及的离散视觉区域数量不成比例地增加。这种处理密度导致内部的“感知过载”,MLLM在隐式生成过程中难以保持准确的空间注意力。为解决这一瓶颈,我们提出TableVision,一个面向基于空间定位的推理的大规模、轨迹感知基准。TableVision将表格任务划分为三个认知层级(感知、推理与分析),覆盖13个子类别。该数据集利用基于渲染的确定性空间定位流水线,将多步逻辑推演与像素级精确的空间真值显式耦合,共包含6,799条高保真推理轨迹。经诊断性探针支持的实证结果表明,显式空间约束能显著恢复MLLM的推理潜力。此外,我们的两阶段解耦框架在测试集上取得12.3%的整体准确率稳健提升。TableVision为文档理解中感知与逻辑的协同提供了一个严格的测试平台与全新视角。

TableVision:面向复杂层级表格空间接地推理的大规模基准:论文配图
图 2:TableVision 基准测试和拟议的基础增强推理框架概述。我们的 TableVision 数据集涵盖具有不同结构密度(例如分层标题)的复杂表格中的各种多模态推理任务。为了减轻结构纠缠,我们引入了一种解耦的微调范例。该模型不是端到端地预测最终答案,而是显式地执行问题感知结构定位(步骤 1)来识别相关的细胞坐标。然后集成这些空间锚点以调节多步骤逻辑计算(步骤 2 和 3),从而实现高度可靠且接地的表格推理。