论文

代理分析:作为条件编码器运行的 VLM 中的定位信号

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

模型评测模型行为与机制分析

摘要

由于其卓越的多模态推理能力,视觉语言模型 (VLM) 越来越多地被用作基于扩散的图像编辑的条件主干。虽然独立的 VLM 表现出强大的本地化功能,但编辑管道经常难以保持这种准确性,特别是在复杂的多实体场景中。在这项工作中,我们研究了这种性能差距,假设它源于将 VLM 视为条件编码器。在此角色中,模型仅限于单个前向传递,从而阻止了其优化的自回归生成过程,从而无法完全暴露其功能。为了研究当 VLM 用作条件编码器时这种空间理解是否持续存在,我们引入了代理分析。在此框架中,我们使用辅助定位任务在 VLM 的中间表示上训练一个轻量级、可解释的代理模型。通过该代理分析 VLM,我们发现了编码本地化信息的特定 VLM 表示。我们的研究结果揭示了 VLM 条件编码器中空间知识的表示方式与当前编辑流程提取空间知识的方式之间存在根本的不匹配。我们发现,在单通道约束下,定位信号无法可靠地传播到常用于调节的预定义层配置。相反,这个关键信号仍然隐藏在中间表示中,其位置根据输入提示而变化。使用我们引入的代理分析框架,我们揭示了编辑管道中现有条件提取策略的根本失败,为更原则性的调节架构设计打开了大门。