论文

VLM 低层视觉表示中的几何相似性

Geometric Similarity in VLM Low-Level Vision Representations

模型评测模型行为与机制分析

摘要

视觉语言模型(VLM)已成为通用视觉主干的强大候选者,其代表性架构包括自回归(AR)模型和扩散Transformer(DiT)。然而,有效地调整它们以进行一体化的低层图像恢复仍然是一个挑战。至关重要的是,该领域缺乏对 VLM 如何组织隐藏层表示以及这些结构上不同的范例是否共享像素级感知的共同几何组织的理解。这种共享组织是构建高度可迁移、统一的恢复 VLM 和适配器的先决条件。在本文中,我们系统地研究了跨 5 个类别的 24 个低层任务的表征相似性。我们提出了 GeoSim,一个统一的四级框架,从全局相似性、局部几何、稀疏特征分解和拓扑验证的角度分析任务条件表示。我们的公式适用于跨相同和跨任务/模型设置分析 AR 模型中的隐藏状态和 DiT 中的特征图。我们的结果揭示了低层视觉表示的组织原则,同时暴露了它们在跨任务和跨模型一致性方面的局限性。最终,GeoSim 提供了一个可解释性分析视角,用于探测低层视觉中的潜在可迁移性,并诊断特定于任务或模型的场景中的模型限制。