论文
TableVision:面向复杂层级表格空间定位推理的大规模基准
TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables
摘要
结构化表格是金融、医疗与科学研究等专业领域传达高密度信息的关键载体。尽管多模态大语言模型(MLLM)不断进步,其在具有层级布局的复杂表格上的推理性能仍然有限。本文通过定量分析识别出一个关键的感知瓶颈。我们发现,随着任务复杂度提升,所涉及的离散视觉区域数量不成比例地增加。这种处理密度导致内部的“感知过载”,MLLM在隐式生成过程中难以保持准确的空间注意力。为解决这一瓶颈,我们提出TableVision,一个面向基于空间定位的推理的大规模、轨迹感知基准。TableVision将表格任务划分为三个认知层级(感知、推理与分析),覆盖13个子类别。该数据集利用基于渲染的确定性空间定位流水线,将多步逻辑推演与像素级精确的空间真值显式耦合,共包含6,799条高保真推理轨迹。经诊断性探针支持的实证结果表明,显式空间约束能显著恢复MLLM的推理潜力。此外,我们的两阶段解耦框架在测试集上取得12.3%的整体准确率稳健提升。TableVision为文档理解中感知与逻辑的协同提供了一个严格的测试平台与全新视角。
