论文
基于 VLM 的视觉语言导航模型依赖什么:解释和指导政策行为
What do VLM-Based Vision-Language Navigation Models Rely on: Interpreting and Steering Policy Behavior
摘要
现代视觉语言导航 (VLN) 模型主要依赖于预先训练的大型视觉语言模型 (VLM) 来预测导航操作。虽然语言指令和视觉观察的这种融合允许多模态推理,但它掩盖了信息如何跨模态路由或驱动导航决策的机制。因此,目前尚不清楚 VLN 模型是否根据相关语义线索进行预测,或者是否可以跟踪任务进度。在这项工作中,我们研究了 VLN 模型的可解释性和可操纵性。我们使用基于干预的指标来衡量视觉观察、指令和视觉记忆如何因果影响导航决策。我们的结果表明,这些导航策略对所有输入方式都很敏感,并且不依赖于单一输入方式。我们进一步表明,这些代理对导航进度进行编码,并保留其 VLM 主干的语义结构,从而通过内部激活实现概念级转向。最后,我们提取抽象行为的激活向量,将它们零样本转移到分布外的现实场景中,从而在无需额外微调的情况下提高性能。