论文
轨迹中的捉迷藏:发现 VLA 运行时监控的故障信号
Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring
摘要
视觉-语言-动作 (VLA) 模型使机器人能够遵循自然语言指令并泛化不同的任务,但它们仍然容易受到执行故障的影响,从而影响实际部署的可靠性。因此,在执行期间检测此类故障对于具体系统的稳健部署至关重要。现有的故障检测方法要么依赖于昂贵的动作重采样或外部模型,而替代方法则在每个时间步上均匀地传播轨迹级标签,从而模糊局部故障信号。在本文中,我们提出了 \textbf{Hide-and-Seek},一个将 VLA 故障检测制定为粗略监督学习问题的框架。通过结合轨迹间和轨迹内对比目标,捉迷藏可以定位故障指示动作,并仅从轨迹级监督中诱导出时间结构化的故障信号,而无需任何步骤级注释。我们在 LIBERO、VLABench 和现实世界的机器人平台上评估了三种代表性 VLA 策略的捉迷藏:OpenVLA、$π_0$ 和 $π_{0.5}$。我们的方法实现了最先进的多任务故障检测性能,并在共形预测下实现了实用的准确性和及时性权衡,并且可以很好地推广到可见和不可见的任务。