论文
FailureSpot:视觉-语言-动作模型的标签高效时间戳级故障检测
FailureSpot: Label-Efficient Timestamp-Level Failure Detection for Vision-Language-Action Models
摘要
视觉-语言-动作 (VLA) 策略在通用机器人操作方面显示出强大的潜力,但它们在长期执行过程中仍然可能出现不可预测的故障,因此可靠的故障检测对于安全部署至关重要。现有方法要么依赖于通常仅在发生错误操作后才检测故障的视觉模型,要么使用在 VLA 内部表示上训练的轻量级主动检测器。然而,这些主动方法通常使用轨迹级标签进行监督,导致不成功轨迹中的正常故障前行为被错误地标记为故障。这种监督不匹配引入了标签噪声,并限制了轨迹级检测精度和精确的时间戳级故障定位。在这项工作中,我们研究细粒度时间戳级 VLA 故障检测,同时解决密集注释的成本。我们提出了一个数据高效的框架,首先利用未标记的 VLA 动作块来构建源自动作的弱监督信号,捕获异常模式,例如不一致的连续块、冻结或空闲动作以及激进的随机运动。然后,我们使用主动学习仅选择最不确定的轨迹进行时间戳级注释,并使用这些信息标签微调检测器。跨多个 VLA 策略的实验表明,我们的方法提高了时间戳级别和轨迹级别的故障检测性能。