论文

VLA-Scope:视觉-语言-动作模型的转变感知故障预测

VLA-Scope: Shift-Aware Failure Prediction for Vision-Language-Action Models

AI 基础设施可观测性

摘要

视觉-语言-动作(VLA)模型将视觉观察和自然语言指令映射到机器人动作,但分布变化可能会损害其可靠性。由于这些模型在分布外 (OOD) 条件下仍可能成功,因此仅检测 OOD 输入不足以预测执行失败。在本文中,我们介绍了 VLA-Scope,这是一个两阶段框架,它将输入分布偏移特征与执行历史记录相结合,以预测 OOD执行轨迹期间的故障。第一阶段使用合并的图像和语言表示来检测 OOD 输入并对它们的分布偏移类别进行分类。对于标记为 OOD 的输入,第二阶段结合了预测类别、动作前缀特征和执行进度特征。随着执行的进行,跨分布偏移类别共享的逻辑斯蒂回归模型会更新失败风险。我们使用留一组交叉验证在十个 LIBERO-Spatial 任务上使用 OpenVLA 评估该框架。 OOD检测的ROC-AUC达到0.9454,分布偏移分类的准确率达到91%。在所有 1,400 个 OOD执行轨迹中独立于 OOD 门进行评估,故障预测器在执行 60 个操作后实现了 0.8497 的 ROC-AUC,而没有执行进度功能时为 0.7906。它还实现了比评估的 ActProbe 和 SAFE-MLP 基线更高的 ROC-AUC。这些结果表明,将动作特征与时间聚合的执行步骤表示相结合可以改善输入变化下的故障预测。