论文

ESsEN:在资源匮乏的环境中训练紧凑判别性视觉语言 Transformer

ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting

模型优化小模型/轻量模型

摘要

随着可用模型列表的不断扩大,视觉语言建模正在迅速普及。在大多数情况下,这些视觉语言模型具有数百亿个参数,这对于某些需求是必要的,但在许多情况下,需要更小的模型(例如,在边缘设备或独立的机器人平台上)。不幸的是,关于生成轻量级模型或使用小数据集训练它们的研究很少。受儿童发展中语言学习进程和数据稀疏性的启发,在本文中,我们以系统的方式解决这两个目标。我们证明,在区分性英语任务的资源匮乏环境中,两塔编码器模型优于一塔编码器。我们还表明,将传统卷积网络合并到两塔 Transformer 架构中可以帮助生成参数高效的视觉语言模型。最后,我们表明,两塔编码器的跨模态融合模块在形状和尺寸上可以显着变化,同时产生相同的结果。此外,我们还提出了 ESsEN,这是一种紧凑的视觉语言模型,可以使用相对较少的资源进行端到端训练,与其他模型相比,只需一小部分参数即可在多项任务上表现良好。我们在这里展示的实验结果和工具使视觉语言建模更容易被更广泛的研究人员使用。