论文
使用视觉语言模型进行空间推理的多视图关系 蒸馏
Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models
摘要
视觉语言模型 (VLM) 已经实现了强大的图像和视频理解,但其视觉空间表示在几何上仍然脆弱,导致实体人工智能、机器人和自动驾驶所需的空间推理失败。先前的几何基础方法要么在空间问题回答上微调 VLM,这可能会永久存在虚假视觉表示,要么融合来自大型几何基础视觉模型的特征,这会大大增加推理时的模型大小。基于几何的视觉模型的 知识蒸馏 提供了一种替代方案,但直接匹配多视图教师特征可能会破坏视觉和文本表示之间的预训练对齐,从而降低对象和语言语义能力。我们提出了多视图关系 蒸馏 (MVRD),它提取视图之间的补丁式余弦相似性,而不是教师特征本身。这些关系编码了足以用于空间理解的几何对应关系,同时使学生的表示不确定,从而使其保持接近其预先训练的视觉语言空间。在代表性的 VLM 中,MVRD 改进了视觉空间推理,优于监督 微调 和特征 蒸馏,同时以相当少的添加参数和更低的延迟实现特征融合方法。我们表明,MVRD 使视觉表示更加几何化,同时保留语言对齐,并推广到 3D 场景理解任务,例如对象基础、密集字幕和问题回答。