论文

感知哪种方式重要:稳健 VLA 策略的证据门控正则化

Sensing Which Modality Matters: Evidence-Gated Regularization for Robust VLA Policies

模型训练监督微调与指令调优

摘要

视觉-语言-动作(VLA)策略融合了多模态感官输入,但对有限且同质的机器人演示进行训练会鼓励虚假的传感器间相关性,而不是与任务相关的信号,我们将这种失败称为模态纠缠。在现实世界的遮挡和干扰下,这表现为对无信息传感器损坏的令人讨厌的敏感性,以及当只有一个信息传感器完好无损时单模态不足。我们提出了证据门控正则化(EGR),这是一种与模态无关的训练目标,引入了零推理时间开销。 EGR 导出每帧和每传感器的任务相关性信号,以控制两个状态条件一致性目标:低证据传感器的不变性和高证据传感器的单传感器充分性。我们引入了一个基于 BEHAVIOR-1K 的基准,包括一个快速的仅推理诊断套件和 47 个针对模态纠缠的基于执行轨迹的技能。我们在此基准测试和两个具有根本不同实施例的真实机器人设置上验证 EGR:具有两个 Kinova 手臂和三个 RGB 摄像头的双手动设置,以及结合视觉和 GelSight 触觉传感器的单臂 MELFA ASSISTA 设置。 EGR 将全模式下的模拟成功率 (SR) 从 12.5% 提高到 16.4% (+31%),在无信息传感器损坏情况下将模拟成功率 (SR) 从 9.4% 提高到 16.5% (+75%),在单传感器回退情况下将模拟成功率 (SR) 从 2.8% 提高到 6.1% (+120%)。在物理物体干扰下,EGR 将双手设置的 SR 从 30% 提高到 85% (+183%),将触觉设置的 SR 从 55% 提高到 70% (+27%)。