论文
MulTaBench:使用文本和图像对多模式表格学习进行基准测试
MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image
摘要
表格基础模型最近通过利用预训练来学习数字和分类结构化数据的通用表示,在监督表格学习中建立了最先进的技术。然而,它们缺乏对文本和图像等非结构化模式的原生支持,并依赖冻结的、预训练的嵌入来处理它们。在已建立的多模态表格学习基准上,我们表明调整任务的嵌入可以提高性能。然而,现有的基准通常只关注模式的同时出现;这会导致数据集之间存在很大差异,并掩盖了特定于任务的调整的好处。为了解决这一差距,我们引入了 MulTaBench,这是一个包含 40 个数据集的基准测试,在图像表格任务和文本表格任务之间平均分配。我们专注于预测任务,其中模态提供互补的预测信号,并且通用嵌入丢失关键信息,需要与任务保持一致的目标感知表示。我们的实验结果表明,目标感知表示调整的收益可以推广到文本和图像模式、多个表格学习器、编码器尺度和嵌入维度。 MulTaBench 构成了迄今为止最大的图像表格基准测试工作,涵盖医疗保健和电子商务等高影响力领域。它旨在支持结合联合建模和目标感知表示的新颖架构的研究,为新颖的多模态表格基础模型的开发铺平道路。