论文
用于 VLA 模型中测试时模态适应的因果感知推断-诊断-优化框架
A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models
摘要
视觉-语言-动作(VLA)模型预测顺序动作以执行语言指令指定的任务,以视觉观察和本体感受状态为条件。然而,如何融合 VLA 模型中的模态仍然是一个悬而未决的问题,因为机器人操纵涉及动态阶段,例如长距离运动和近距离交互,其中视觉观察的重要性可能随时间而变化。在本文中,我们提出了一种推断-诊断-细化(IDR)框架,这是一种与模型无关的框架,可以与各种 VLA 架构集成,以在测试时细化动作预测。 IDR首先推断视觉观察的事实和反事实场景下的动作,然后将视觉观察的因果效应诊断为估计的动态重要性,最后用于以无需训练方式细化动作预测。我们进一步设计了一个因果感知的行动细化器来实现 IDR 框架,包括用于推断反事实行动的零填充干预、用于诊断因果效应的基于规范的量化以及用于细化行动的门控残差融合。对模拟基准和实际任务的大量实验表明,多个 VLA 主干的整体性能得到了改善,证明了在测试时动态调整视觉重要性的功效。