论文

基于多模态大语言模型的高效表格检索与理解

Efficient Table Retrieval and Understanding with Multimodal Large Language Models

上下文与知识检索增强

摘要

在财务报表、手写记录和文档扫描等众多现实场景中,表格数据常以图像形式被采集。这类视觉表示兼具结构复杂性与视觉复杂性,给机器理解带来独特挑战。尽管多模态大语言模型(MLLM)的最新进展在表格理解上显示出可观的成果,它们通常假设相关表格是现成可用的。然而,更实际的场景是从大规模表格集合中识别相关表格并对其进行推理,以回答用户查询。为填补这一空白,我们提出TabRAG,一个使MLLM能够对大规模表格图像集合回答查询的框架。该方法首先使用联合训练的视觉-文本基础模型检索候选表格,随后利用MLLM对这些候选进行细粒度重排序,最后由MLLM对选中的表格进行推理以生成答案。在一个新构建的数据集上开展了大量实验,该数据集包含88,161个训练样本与9,819个测试样本,覆盖8个基准、48,504张不同表格;结果表明,我们的框架在检索召回率上显著优于现有方法7.0%,在答案准确率上优于6.1%,为现实世界的表格理解任务提供了实用方案。