论文

TokenSwap:多式联运中的基准测试和减少模态差距 LLM

TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 应在给定跨模态的语义等效输入的情况下生成一致的响应。然而,我们观察到在这种跨模式变化下模型预测存在系统差异。具体来说,我们将模态差距定义为语义等效文本和多模态输入下模型性能的差异。我们引入了 TokenSwap,一种通过用语义对齐的图像替换文本概念来构造此类输入的方法,从而产生视觉标记与文本标记交错的序列。基于 TokenSwap,我们将现有的基于文本的基准(例如 MMLU)转换为图像交错的对应基准,从而产生了 TokenSwap-Bench。在 42 个 MLLM 中,我们观察到普遍存在的模态差距,当从纯文本输入转向图像交错输入时,性能下降了 4.2% 至 47.4%,各个模型的平均性能下降了 19.6% +/- 3.3%。值得注意的是,我们观察到推理模型始终表现出较小的差距,平均差距为 10.1%,而非推理模型的平均差距为 25.5%。相比之下,单独的提示策略和扩展训练计算都不能可靠地缩小模态差距。最后,我们证明,在训练期间结合 TokenSwap 可以有效地缩小这一差距,同时保持强大的纯文本和视觉语言性能。