论文
StageGuard:通过代理蒸馏学习长视野机器人任务的阶段转换
StageGuard: Learning Stage Transitions for Long-Horizon Robot Tasks via Agentic Distillation
摘要
分层规划框架结合了多个机器人控制策略的技能,以执行长期任务,其中确定何时终止当前技能并前进到下一个子任务至关重要。现有的方法通常依赖于预先设计的完成信号检查器,而这些检查器在现实世界的执行中很难获得。大规模视觉语言模型(VLM)提供强大的推理能力,但其决策边界本质上并不与任务完成标准一致,而云部署和冗长的推理会带来大量延迟,限制实时监控。我们提出了 StageGuard,这是一种用于准确高效的阶段转换决策的代理蒸馏框架。 StageGuard 将教师模型推理与演示轨迹相结合,生成子任务完成和策略切换的结构化解释。轻量级学生 VLM 使用这些解释来生成紧凑的自我解释,用于监督微调。我们根据两个基准评估轨迹的阶段转换预测,并通过集成到 BEHAVIOR-1K 上的分层机器人控制来评估闭环任务的成功程度,并在真实机器人上进行进一步验证。结果表明,在支持高效在线监测的同时,阶段转换预测得到了显着改进。