论文

视觉语言动作模型真的理解指令吗?语言对动作的机制分析

Do Vision-Language-Action Models Understand Instructions? A Mechanistic Interpretability Study on Language Grounding

模型评测应用与实践模型行为与机制分析鲁棒性、公平性与可信度评测机器人

摘要

视觉语言动作模型旨在泛化到不同环境和任务描述,因此需要回答一个问题:动作生成是否真正依赖语言指令,还是主要依赖视觉线索和表面相关性?对视觉与语言观测变化的鲁棒性对真实部署至关重要,但VLA没有显式接地模块,而是依赖视觉语言骨干的内在语言接地能力。因此,我们对π0.5和GR00T N1.7开展受控机制可解释性研究,在动作生成模块的残差流上进行激活修补与归因修补。针对LIBERO样本,按五种方式扰动任务指令:同义词替换、语义缩放、方向破坏、随机物体替换和空字符串。实验发现,两种模型对抽象改写和不存在物体的引用相对不敏感,但对空任务描述、尤其是方向语言反应明显。动作生成时,这种敏感性集中位置因模型而异:GR00T N1.7主要集中于早期周期性交叉注意力层,π0.5则分布于最早及部分后层。对GR00T N1.7,方向扰动产生部分最大的因果效应,但内部表征几何相对不变;在π0.5中未清楚观察到这种分离。归因修补的可靠性也取决于模型:它在GR00T N1.7上较好地跟随激活修补结果,在π0.5上则不然。

视觉语言动作模型真的理解指令吗?语言对动作的机制分析:论文原图
图 1:方法概述。我们研究 π0.5\pi_{0.5} 和 GR00T N1.7 在动作解码过程中如何处理语言指令。 (1) 我们按照六种不同的扰动策略破坏干净的指令。 (2)我们在动作解码期间记录两个模型的残差流激活。 (3)我们使用归因修补(3.1)、激活修补(3.2)和居中内核对齐(3.3)来分析因果和表征变化