论文

揭示视觉-语言-动作模型在联合级物理故障下的脆弱性

Uncovering Vulnerability of Vision-Language-Action Models under Joint-Level Physical Faults

模型评测鲁棒性、公平性与可信度评测

摘要

在真实的机器人系统中部署视觉-语言-动作(VLA)模型不仅需要对语义和感知变化具有鲁棒性,而且还需要对改变动作物理实现方式的实施方故障具有鲁棒性。真实的机器人可能会经历由执行器退化、硬件故障、安全限制、碰撞损坏或磨损引起的摩擦引起的关节级变化。这些错误至关重要,因为它们改变了策略的动作到动作的接口,破坏了命令动作、实现的动作和后续观察之间习得的闭环关系。在这项工作中,我们研究了现实的关节级物理故障,并表明当通过扰动的机器人身体执行预测动作时,VLA 模型很容易受到攻击。我们的分析揭示了关节依赖性效应,受影响关节的任务成功率存在异质性退化。我们还表明,性能下降不能仅仅归因于物理不可行性,因为诸如关节摩擦增加之类的可行故障仍然会大大降低成功率并导致闭环执行不匹配。受这些发现的启发,我们提出了联合级物理故障感知残差校准器(J-PARC),这是一种建立在冻结 VLA 策略之上的轻量级残差校准框架。 J-PARC 从最近的关节动态中推断出潜在的关节故障状态,并在该状态上设置共享剩余校准器,从而能够对故障关节进行自适应动作校正。实验表明,J-PARC 提高了联合级故障下的鲁棒性,同时保持无故障环境性能。