论文

TrustVLA:针对视觉-语言-动作后门的机制引导推理时间防御

TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors

智能体系统Agent 动作执行与治理

摘要

视觉-语言-动作(VLA)模型通过最终用户无法审核的管道进行部署,中毒的 VLA 可以在干净的观察中正常运行,而小的视觉触发器会在任何故障变得可观察到之前重定向长视野机器人策略。现有的视觉或语言防御很少解释触发的 VLA 表征是什么样子或如何在不重新训练的情况下恢复行为。我们通过两个独立提出的 VLA 攻击(来自具有不同注入策略的群体 BadVLA 和 INFUSE)来研究这一差距;后者在下游清洁适应后仍然存在。在评估的中毒模型中,我们确定了一个重复出现的内部机制:\emph{紧凑因果足迹},即一个小的视觉支持,它是注意力种子,空间紧凑的,并且 \emph{因果} 是精确意义上的——掩盖它,将干净校准的证据进化分数返回到正常操作区域。这种足迹激发了 TrustVLA,这是一种机制引导的推理时间防御,它采用来自可信分类的狄利克雷证据框架来监控 VLA 策略中每个词元、每个层的认知不确定性。仅用一个小的干净校准集,TrustVLA (i)~检测异常证据演化,(ii)~通过反事实机制得分下降来定位紧凑支持,以及 (iii)~通过局部修复恢复观察结果。在 OpenVLA/LIBERO 和 $π_{0.5}$ 传输评估中,TrustVLA 降低了攻击成功率,同时保持干净任务性能,为视觉触发的 VLA 后门提供无需重新训练的机制引导防御。