论文
FLARE:视觉语言机器人操作中自主纠正和恢复的故障感知框架
FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation
摘要
视觉-语言-动作模型~(VLA)在推广复杂的长视野机器人操作任务方面表现出了巨大的前景。然而,它们的性能仍然很脆弱,因为它们通常接受轨迹单调、无故障演示的训练。这种对“完美”数据的依赖使它们无法从常见的执行错误中恢复,例如错过抓取、掉落的物体或意外碰撞。在本文中,我们提出了 FLARE,这是一种新颖的框架,通过“重试”和“重置”范式赋予 VLA 强大的错误恢复能力。首先,我们引入了一种“重试”机制,通过注入扰动和桥接段将机器人姿势与环境状态解耦到演示中,使策略能够自主执行处理执行偏差。其次,为了解决关键的、破坏状态 (OOD) 的故障,我们引入了“重置”管道。我们利用 MLLM 进行离线故障分析,自动从执行视频中识别 OOD 状态。这种分析能够高效、有针对性地收集以对象为中心的“重置”技能小型库,这些技能经过训练,可以将环境恢复到任务有效状态。我们的完整框架整合了这些学到的政策。在推理时,在线 MLLM 监视器在任务执行和“重置”技能之间进行仲裁。对具有挑战性、接触丰富的操作任务的实验表明,我们的方法显着提高了任务的成功率和鲁棒性。