论文
ProAct-VLM:具有连续感知反馈的故障前视觉语言任务重新规划
ProAct-VLM: Pre-Failure Vision-Language Task Replanning with Continuous Perception Feedback
摘要
长视野机器人任务很容易受到意外环境变化的影响,从而导致计划的行动无效或不安全。为了解决这个问题,机器人必须检测发生的变化,解释其影响,并相应地调整其行动。传统的基于规则的决策流程在开放世界条件下很脆弱,因为它们是针对特定场景手动调整的并且缺乏泛化性。视觉语言模型 (VLM) 提供了一种有前途的替代方案,因为它们将广泛的世界知识与统一的视觉文本推理相结合,使它们能够在不同的场景中进行概括并生成准确、扎实的任务计划。然而,为了在动态现实环境中进行有效部署,VLM 必须嵌入到能够处理不确定性和环境变化的框架中。现有框架广泛地被动地解决这个问题,仅在执行失败或任务后检查后触发重新计划,从而冒着操作失败的风险。有些方法在执行操作之前验证条件,但这些离散检查会错过执行期间发生的更改。为了解决这个问题,我们提出了 ProAct-VLM,这是一种自适应的、基于物理的任务规划框架,它将 VLM 集成到实时感知反馈循环中。 ProAct-VLM 持续监控环境,并在检测到相关变化后立即重新规划,从而在故障发生之前进行调整。针对多个基线和不同 VLM 主干的评估表明,我们的框架提高了动态、长视野操作任务的成功率和效率。项目页面:https://github.com/moured/ProAct-VLM