论文

ProbeAct:视觉-语言-动作模型中探针引导的 无需训练 故障恢复

ProbeAct: Probe-Guided Training-Free Failure Recovery in Vision-Language-Action Models

智能体系统Agent 动作执行与治理

摘要

视觉-语言-动作 (VLA) 模型在其训练分布 2 内的语言条件机器人操作方面表现出强大的性能 1,但其泛化能力仍然受到根本限制。它们缺乏处理扰动所需的鲁棒性,当 con-4 面临光照变化、摄像机视角改变或初始状态变化较小时,它们经常会失败。我们提出 PROBEACT,一种 无需训练 运行时干预框架 6 工作,可检测 7 岁之前训练的 VLA 策略中的抓取和放置失败并从中恢复,而无需修改其权重或需要额外的8演示。 PROBEACT 结合了三个组件:(i) 轻量级多 9 目标隐藏状态探针,可根据中间 VLA 特征预测任务相关对象 10 的 3D 位置,并针对 11 多对象场景进行匈牙利匹配的身份跟踪; (ii) 与物体无关的运动学状态机,仅使用夹具内部信号和末端执行器运动学来检测抓取、运输和放置故障; (iii) 分层控制屏障函数 (CBF)14 过滤器,将重复故障位置编码为软安全设置约束,mini-15 主要纠正 VLA 操作,同时保留基线行为。作为即插即用的 无需训练 干预循环,PROBEACT 与现有的 train-17 ing 管道正交。根据 LIBERO-plus 基准进行评估,我们的框架充当18通用安全网,将 OpenVLA-OFT 模型19的成功率从 69.6% 提高到 74.1%,同时展示了对基础和微调 VLA 策略的广泛适用性。