论文

VT-Bench:视觉表格多模态学习的统一基准

VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning

模型评测基准与评测资源

摘要

多模型学习在视觉文本任务中引起了极大的关注。然而,在医疗保健和工业等高风险领域发挥着关键作用的可视化表格数据仍未得到充分探索。在本文中,我们介绍了 \textit{VT-Bench},这是第一个标准化视觉表格判别预测和生成推理任务的统一基准。 VT-Bench 聚合了 9 个领域(以医疗为中心,同时涵盖宠物、媒体和交通)的 14 个数据集,包含超过 756K 的样本。我们评估了 23 个代表性模型,包括单峰专家、专门的视觉表格模型、通用视觉语言模型 (VLM) 和工具增强方法,强调了视觉表格学习的重大挑战。我们相信 VT-Bench 将刺激社区构建更强大的多模态视觉表格基础模型。基准测试:https://github.com/Ziyi-Jia990/VT-Bench