论文

RoboMonitor:以少量标注监测机器人执行阶段与失败

RoboMonitor: Label-Efficient Runtime Monitoring of Robot Task Execution via Predictive Representation Learning

智能体系统模型训练监督微调与指令调优Agent 动作执行与治理

摘要

学习的机器人策略会产生行动,但它们的输出本身并不能确定执行是否按预期进行。机器人执行监控需要识别当前执行阶段、检测故障并根据执行期间可用的观察结果识别任务完成情况。训练此类监视器需要注释,而这些注释在为机器人策略学习收集的数据集中很少。我们推出了 RoboMonitor,一种标签高效的视觉语言执行监视器,它在引入监视监督之前从这些数据集中学习。我们使用动作条件的未来特征预测、逆动力学和屏蔽当前预测,对涵盖 12 个操作任务和两种机器人形态的 25 小时多摄像机轨迹进行预训练。然后,我们将学习到的视觉和上下文编码器转移到因果监视器,并应用时间监督微调(Temporal SFT),它将每个观察窗口的监督与重叠窗口内和重叠窗口之间的一致性目标结合起来。部署时,RoboMonitor 仅需要任务指令和摄像头观察。在四任务监控基准上,使用 52 个标记片段进行训练的 RoboMonitor 在两个微调种子上实现了 93.1% 的平均阶段准确率和 85.9% 的宏召回率,超过了使用相同监控监督训练的 Qwen3-VL 和 Robometer。其阶段准确率也超过了使用100个训练片段的 Qwen3-VL 和 Robometer。 Qwen3-VL 消融表明,时间 SFT 将平均错误阶段切换从 15.23% 降低到 4.95%。在闭环部署中,集成系统完成了 40 次模拟工具箱排序试验中的 39 次和 40 次真实卷包装试验中的 35 次,没有观察到错误恢复触发。

RoboMonitor从机器人轨迹预训练,再以时间监督适配执行阶段和失败监测。
图1(图注摘要):RoboMonitor从机器人轨迹预训练,再以时间监督适配执行阶段和失败监测。