论文
V-Reflection:将 MLLM 从被动观察者转变为主动询问者
V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators
摘要
多模态 大语言模型 (MLLM) 取得了显着的成功,但它们在细粒度任务中仍然容易出现与感知相关的幻觉。这种漏洞源于一个根本性的限制:它们的推理很大程度上局限于语言领域,将视觉输入视为静态的、与推理无关的序言,而不是动态的参与者。因此,当前的模型充当被动观察者,无法重新检查视觉细节以奠定其不断发展的推理状态。为了克服这个问题,我们提出了 V-Reflection,这是一个通过“思考然后观察”视觉反射机制将 MLLM 转变为主动询问器的框架。在推理过程中,潜在状态充当动态探针,主动询问视觉特征空间,为任务关键证据的每个推理步骤奠定基础。我们的方法采用两阶段 蒸馏 策略。首先,盒子引导压缩模块(BCM)通过显式空间基础建立稳定的像素到潜在目标。接下来,动态自回归压缩 (DAC) 模块将模型的隐藏状态映射到询问全局视觉特征图的动态探针中。通过将 BCM 教师的空间专业知识提炼给 DAC 学生,V-Reflection 内化了本地化任务关键型证据的能力。在推理过程中,两个模块都保持完全不活动状态,以最佳效率在潜在空间中保持纯粹的端到端自回归解码。大量实验证明了我们的 V-Reflection 在六个感知密集型基准中的有效性,显着缩小了细粒度感知差距。可视化证实,潜在推理可以自主定位任务关键型视觉证据。