论文

Rewind-IL:用于模仿学习的在线故障检测和状态重生

Rewind-IL: Online Failure Detection and State Respawning for Imitation Learning

模型推理推理验证与自校正

摘要

模仿学习使机器人能够从演示中获得复杂的视觉运动操纵技能,但部署失败仍然是一个主要障碍,特别是对于长期行动块政策而言。一旦执行偏离了演示流形,这些策略通常会继续产生局部合理的行动,而不会从失败中恢复。现有的运行时监视器要么需要故障数据,要么在良性特征漂移下过度触发,要么在故障检测时停止而不提供恢复机制。我们提出了 Rewind-IL,这是一个用于生成动作块模仿策略的 无需训练 在线保护框架。 Rewind-IL 将基于时间块间差异估计 (TIDE) 的零样本故障检测器(通过分割共形预测进行校准)与状态重生机制相结合,使机器人返回到经过语义验证的安全中间状态。离线时,视觉语言模型在演示中识别恢复检查点,并使用冻结的策略编码器构建紧凑的检查点特征数据库。在线时,Rewind-IL 会监视重叠操作块中的自一致性,跟踪与检查点库的相似性,并在发生故障时将执行回退到最新验证的安全状态,然后从干净的策略状态重新启动推理。对现实世界和模拟长视野操作任务的实验,包括转移到流匹配动作分块策略,表明策略内部一致性与基于语义的重生相结合,为提高模仿学习的可靠性提供了一条实用途径。补充材料可在 https://sjay05.github.io/rewind-il 获取