论文

经模态缺口感知蒸馏从符号状态学习视觉空间规划

Learning Visual Spatial Planning from Symbolic State via Modality-Gap-Aware Self-Distillation

摘要

虽然视觉语言模型擅长一般的多模态理解,但它们仍然在视觉空间规划方面遇到困难。我们将这种限制归因于感知-推理模式的差距。视觉规划需要模型从像素推断潜在状态结构,然后对恢复的结构进行推理以产生有效的动作,而符号规划则直接利用显式表示。这种差异引入了两个连续的瓶颈:感知阶段的视觉状态恢复和推理阶段的多步骤规划。为了解决这个问题,我们提出了 MGSD,一种两阶段模态间隙感知自蒸馏框架。首先,冷启动锚定阶段在策略训练之前建立可靠的视觉状态恢复。其次,符号引导的同策略自蒸馏阶段通过对学生生成的前缀进行词元级监督,将特权教师的规划行为转移给学生。至关重要的是,符号信息仅在训练期间使用,而推理完全依赖于视觉输入。视觉规划基准实验表明,MGSD 在不同模型尺度上持续提高性能,分别将宏观平均值提高 19.3% 和 18.4%。由此产生的模型大大减少了与符号输入获得的上限的差距。消融研究和诊断分析进一步证实,视觉状态恢复和最佳路径推理的改进带来了收益。这些结果表明,MGSD 不仅增强了从视觉观察中恢复可操作状态的能力,而且还增强了规划推断结构的能力。代码可在 https://github.com/Oranger-l/MGSD 获取。

经模态缺口感知蒸馏从符号状态学习视觉空间规划:论文配图
图 1:MGSD 的概述和有效性。 (a)视觉推理范式的比较。 MGSD 仅在训练期间使用符号监督,并且在推理期间仅需要视觉输入。 (b) 与基本模型和相应的符号输入上限的比较。