论文
视觉语言动作模型真的理解指令吗?语言对动作的机制分析
Do Vision-Language-Action Models Understand Instructions? A Mechanistic Interpretability Study on Language Grounding
摘要
视觉语言动作模型旨在泛化到不同环境和任务描述,因此需要回答一个问题:动作生成是否真正依赖语言指令,还是主要依赖视觉线索和表面相关性?对视觉与语言观测变化的鲁棒性对真实部署至关重要,但VLA没有显式接地模块,而是依赖视觉语言骨干的内在语言接地能力。因此,我们对π0.5和GR00T N1.7开展受控机制可解释性研究,在动作生成模块的残差流上进行激活修补与归因修补。针对LIBERO样本,按五种方式扰动任务指令:同义词替换、语义缩放、方向破坏、随机物体替换和空字符串。实验发现,两种模型对抽象改写和不存在物体的引用相对不敏感,但对空任务描述、尤其是方向语言反应明显。动作生成时,这种敏感性集中位置因模型而异:GR00T N1.7主要集中于早期周期性交叉注意力层,π0.5则分布于最早及部分后层。对GR00T N1.7,方向扰动产生部分最大的因果效应,但内部表征几何相对不变;在π0.5中未清楚观察到这种分离。归因修补的可靠性也取决于模型:它在GR00T N1.7上较好地跟随激活修补结果,在π0.5上则不然。
