论文

MODIX:视觉语言模型的 无需训练 多模态信息驱动位置索引缩放

MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models

模型架构Transformer

摘要

视觉语言模型(VLM)在多模态理解方面取得了显着进展,但其位置编码机制仍然不够理想。现有方法统一为所有标记分配位置索引,忽略了模态内部和模态之间信息密度的变化,这导致注意力分配效率低下,其中冗余视觉区域占主导地位,而信息内容代表性不足。我们将位置粒度确定为隐式资源,并提出了 MODIX(多模态信息驱动位置索引缩放),这是一个 无需训练 框架,可根据特定模态的贡献动态调整位置步幅。 MODIX 通过基于协方差的熵对模态内密度进行联合建模,并通过跨模态对齐对模态间交互进行联合建模,以得出统一的分数,从而重新调整位置索引,为信息模态分配更细的粒度,同时压缩冗余模态,而不需要对模型参数或架构进行任何修改。跨不同架构和基准的实验表明,MODIX 持续改进多模态推理,并根据任务相关信息分布自适应地重新分配注意力,这表明位置编码应被视为 Transformer 中用于多模态序列建模的自适应资源。