论文
视觉语言模型需要处理图像标记吗?
Do Vision Language Models Need to Process Image Tokens?
摘要
视觉语言模型 (VLM) 通过将视觉编码器与 大语言模型 (LLM) 集成,取得了显着的成功。虽然 VLM 跨深度 Transformer 堆栈处理密集的图像标记(产生大量的计算开销),但从根本上讲,仍然不清楚持续的图像标记处理对于其性能或视觉表示从早期层到后期层的有意义的演变是否是必要的。在这项工作中,我们系统地研究了图像标记在 VLM 中的功能作用,并表明视觉表示迅速收敛到有限复杂度状态,即它们的熵稳定,内在维度压缩,并且轨迹曲率接近恒定轮廓。相比之下,文本表示继续在深度上进行实质性重组。一旦稳定,视觉表示在各层之间很大程度上可以互换,这表明更深层次的额外转换有限。此外,深度视觉截断揭示了视觉处理的必要性是依赖于任务的,其中单标记预测对于截断的视觉深度仍然相对稳健,但多标记生成需要持续访问视觉表示。在确定性解码下,减少视觉深度对中间推理轨迹的干扰比对最终输出的干扰更大,这表明图像标记对推理结构的影响大于最终结论。总的来说,这些发现\textbf{质疑了更深层次的视觉处理在 VLM 中同样重要的假设,挑战了当前多模态 LLM 架构的范式。