论文

G$^2$TR:单独编码器统一多模态模型的生成引导视觉标记缩减

G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models

摘要

由于密集的视觉标记处理,独立编码器统一多模态模型(UMM)的开发伴随着推理成本的快速增长。在本文中,我们重点关注理解端视觉标记的减少,以提高分离编码器 UMM 的效率。虽然该主题已针对 MLLM 进行了广泛研究,但现有方法通常依赖于注意力分数、文本图像相似度等,隐含地假设最终目标是判别推理。这一假设不适用于 UMM,其中理解端视觉标记还必须保留模型编辑图像的功能。我们提出了 G$^2$TR,一种用于分离编码器 UMM 的生成引导视觉标记缩减框架。我们的主要见解是,生成分支提供了一个与任务无关的信号,用于识别理解端视觉标记,这些标记不仅在语义上相关,而且对于潜在空间图像重建和生成也很重要。 G$^2$TR根据与VAE潜在的一致性来估计词元重要性,执行平衡词元选择,并将冗余词元合并到保留的代表中以减少信息丢失。该方法是无需训练,即插即用,仅在理解编码阶段后应用,使其与现有的UMM推理管道兼容。图像理解和编辑基准的实验表明,G$^2$TR 将视觉标记和预填充计算量大幅减少了 1.94 倍,同时保持了推理准确性和编辑质量,几乎在所有基准上都优于基准。代码位于:https://github.com/lijunxian111/G2TR。