论文
ViQ:任何分辨率下的文本对齐视觉量化表示
ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
摘要
文本和视觉的统一表示是一种自然的追求,因为它可以实现更简单的多模态建模和更高效的训练。然而,以与文本相同的方式将图像表示为离散信号不可避免地会导致严重的信息丢失。现有的工作努力平衡离散表示中的底层细节和高级语义:面向重建的表示通常缺乏语义信息,而语义上更强的特征通常会严重丢失细节。我们提出了 ViQ,一种视觉量化表示框架,旨在平衡离散表示中的语义和细节,同时支持原始分辨率的输入,从而使其能够充当任意视觉输入的统一且通用的离散表示。我们的方法将量化学习分为两个阶段:文本对齐 预训练 和特征离散化。通过文本对齐的 预训练,我们增强了来自预训练语言模型的视觉编码器语义丰富的监督,并使其能够处理本机分辨率的视觉输入。在离散化过程中,我们提出了一种近端表示学习策略来逐步压缩特征空间,以及一种位置感知的头向量化机制,可以灵活处理任意分辨率。对多模态任务的大量实验表明,与具有连续和高维视觉特征的最先进的多模态视觉编码器相比,ViQ 实现了具有竞争力的性能,同时在底层重建中保持高精度。我们还表明,具有视觉量化表示的多模态训练极大地提高了效率,使用不同的基础 LLM 和训练配方可产生高达 20%-70% 的加速。