论文
没有 微调 的模块化多模态分类:一种简单的组合方法
Modular Multimodal Classification Without Fine-Tuning: A Simple Compositional Approach
摘要
我们引入了 CoMET,\textit{\textbf{C}将 \textbf{M}odality \textbf{E}ncoders 与 \textbf{T}abular 基础模型}组合在一起,这是一种简单但极具竞争力的多模态分类方法:将每个模态通过冻结的预训练主干,用 PCA 压缩生成的嵌入,并作为输入连接到表格基础模型(TFM)中进行预测。我们证明,仅 PCA 就足以充当适配器,在多种模式下产生强大、鲁棒的性能。当基础模型的 CLS 标记与下游任务不一致时,我们提出了 PALPooling,这是一种轻量级自适应标记池,可以持续提高表示质量。通过使用 TFM 组成强大的冻结表示学习主干,我们的方法无需任何训练即可在不同的多模态基准上实现最先进的结果。在具有大型细粒度类空间的分层任务中,我们的方法可以实现快速且可扩展的分类,处理具有超过 500,000 个样本和 2,000 个类的数据集,而无需任何 微调。总的来说,我们的结果表明,基础模型的组成是一种简单但强大的开箱即用的多模态学习解决方案,挑战了解决新问题的复杂的端到端训练管道的必要性。