论文

研究图像分词器作为统一多模态模型中的视觉语言

Studying Image Tokenizers as Visual Languages in Unified Multimodal Models

模型评测评测方法与指标

摘要

图像标记器定义了统一多模态模型的“视觉语言”,但通常通过孤立的指标或仅生成/理解的评估来研究。这些评估并没有完全捕获视觉标记与文本联合建模时的行为方式。我们构建了一个受控的纯自回归测试床,并在跨文本、图像、文本到图像 (T2I) 和图像到文本 (I2T) 预测的多模式连续预训练期间跟踪特定于任务的验证损失。我们研究这些损失如何扩展以及与下游性能的关系,然后使用它们来研究多模式可学习性(图像和文本标记的联合建模效果如何)以及标记器设计。我们发现(1)损失应该按任务进行分析,因为它们表现出不同的缩放行为并且对标记器进行不同的排名。 (2) 损失-性能关系取决于预测的标记空间:对于固定标记器,T2I 和 I2T 损失与生成质量相关,但在标记器中,T2I 损失-性能关系随图像标记空间而变化,而通过共享文本词汇计算的 I2T 损失提供了更一致的信号。 I2T 损失还与监督微调后的生成和视觉理解性能相关。使用损失作为镜头,我们表明(3)更好的重建不一定会产生更低的特定于任务的损失或更强的下游性能,并且(4)图像标记器的选择可以影响联合优化下的文本建模。作为案例研究,我们重新审视三个分词器设计轴——鉴别器、语义监督和词汇量——以检查它们对联合建模和下游性能的影响。总之,我们的测试床提供了图像标记器作为视觉语言的补充视角,突出了它们在联合多模式训练中与文本的相互作用。