论文

VLM 内伪装视觉上下文的隐藏演变

The Hidden Evolution of Disguised Visual Context inside the VLM

模型评测模型行为与机制分析

摘要

视觉标记作为原始外部信号输入 大语言模型 (LLM)。它们如何转换为有意义的表示并与语言空间交互完全取决于集成架构。无论是将视觉标记视为输入序列中的上下文提示,还是将它们直接注入到 LLM 的中间层中。对这些架构选择如何影响视觉信息及其与 LLM 集成的内部转换的受控比较和理解仍有待探索。我们通过在相同的训练条件下跨单图像、多图像和视频基准评估上下文和分层注入 VLM 集成范例来提供公平的比较。在此过程中,我们发现了一个隐藏的演变,其中视觉标记作为伪装的视觉上下文进入 LLM,缺乏语言结构的原始表示,但根据集成范式逐渐重塑,每个标记都捕获视觉信号的根本不同的频率特征。我们证明,LLM 内部的这种演变决定了 VLM 可以有效利用哪些视觉特征、视觉表示如何与语言空间保持一致,以及最终每个范例如何在不同任务中执行。我们进一步证明,仅注意分配是不够的,性能是由每一层视觉表示的质量驱动的。