论文
CofactVLA:通过反事实干预消除视觉-语言-动作模型的混杂
CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention
摘要
视觉-语言-动作(VLA)模型推动了机器人操作的重大进展,但它们从根本上与视觉覆盖现象作斗争。由于密集的视觉流和稀疏的语言指令之间严重的模态不平衡,VLA 经常陷入因果混乱。该策略没有将语言视为主要因果驱动因素,而是通过过度拟合虚假的视觉混杂因素(例如突出的物体或熟悉的布局)来完全绕过原始指令。为了系统地缓解这种偏差,我们将行动生成过程形式化为双路径去混杂图(DDG),并提出了 CofactVLA,一种新颖的因果干预框架。通过在单个前向传递中动态构建语言屏蔽的反事实分支,CofactVLA 通过两种协同机制来隔离和中和视觉混杂因素。首先,动作级正交投影指导(OPG)在连续流匹配过程中以几何方式投影事实速度场,使其远离反事实视觉偏差,提取纯语义意图。其次,特征级反事实协方差减少(CCR)通过惩罚协方差差异的正特征空间,在数学上解构潜在表示,显式抑制占主导地位的视觉捷径,同时保留因果语言意图。大量实验表明,CofactVLA 在不同的模拟基准上建立了新的最先进水平。除了模拟之外,现实世界的机器人实验还证明了我们的方法在弥合泛化差距方面的因果功效,在分布外场景下获得了 52.3% 的绝对成功率增益。