论文
通过预测域不变潜在前瞻来解开视觉-语言-动作模型中的虚假相关性
Disentangling Spurious Correlations in Vision-Language-Action Models via Predicting Domain-Invariant Latent Lookahead
摘要
视觉-语言-动作(VLA)模型在视觉分布变化的情况下仍然很脆弱,通常依赖于与特定领域因素相关的虚假相关性,而不是与任务相关的结构。我们提出了域不变潜在前瞻(DILL),这是一种表示学习框架,可以减轻 VLA 策略中的捷径学习。我们的关键思想是利用从领域转换轨迹数据中学习到的领域不变的未来潜伏来监督政策。任务域编码器通过对比目标和高斯解缠正则化进行训练,以将任务相关结构与特定领域的视觉变化分开。然后,学习到的编码器通过前瞻预测和域解缠为 VLA 策略学习提供未来的潜力,鼓励策略关注与任务相关的结构而不是偶然的视觉因素。反事实任务视图评估表明,DILL 减少了对捷径的依赖,而 LIBERO-Plus 评估则证明了视觉鲁棒性的提高,平均成功率为 69.1%,比最强基线高出 11.4 个百分点。现实世界的操纵实验进一步支持了 DILL 超越受控模拟的适用性。互补的潜在空间诊断表明,这些行为增益伴随着更好地保留任务一致性结构同时抑制特定领域变化的表征。我们的项目页面位于 https://dill-vla.github.io/.