论文
IMPACT-VLA:通过视觉-语言-行动策略的反事实轨迹进行交互感知的多模态传播归因
IMPACT-VLA: Interaction-aware Multimodal Propagation Attribution via Counterfactual Trajectories for Vision-Language-Action Policies
摘要
视觉-语言-动作 (VLA) 策略使用多模态输入(例如视觉观察、本体感受状态和语言指令)执行机器人操作任务。然而,目前尚不清楚每种模式在哪些执行阶段有助于最终任务的成功,以及输入干预如何通过后续状态、观察和行动传播。现有的归因方法主要测量局部敏感性或暂时聚合的重要性,限制了它们捕获阶段相关贡献和跨阶段依赖性的能力。我们提出通过视觉-语言-行动策略的反事实轨迹进行交互感知的多模态传播归因(IMPACT-VLA)。 IMPACT-VLA 从成功的参考执行轨迹中的操作转换构建行为阶段,将它们与策略查询边界对齐,并将阶段模态块定义为归因单元。然后,它执行闭环反事实重新执行,以量化每个块对最终任务成功的贡献。我们进一步分析跨阶段非加性相互作用和轨迹传播,同时区分行为恢复和功能恢复。在使用 OpenVLA-OFT 的 30 个 LIBERO 机器人操作任务中,有 25 个任务 (83.3%) 发生了主导模态转换,并且闭环归因比静态动作扰动更准确地识别任务关键信息。在早期输入替换下,负相互作用对的后期块边际增益增加了约 3.3 倍,而功能恢复可能会在没有行为恢复的情况下发生。这些结果揭示了多模式输入何时支持任务成功,以及它们的贡献如何在闭环执行期间有条件地耦合。