论文

ProactiveVLA:主动探索与交互记忆增强冻结 VLA

ProactiveVLA: Augmenting Embodied Memory through Proactive Environment Exploration

智能体系统Agent 环境交互

摘要

快速适应新环境需要机器人从有限的经验中获取有关局部物体、状态和交互的有用知识。将推理智能体与冻结视觉语言动作模型 (VLA) 相结合的系统可以通过执行反馈和记忆进行调整,从而使体验的选择成为其有效性的核心。目标任务的重复练习可能会完善熟悉的解决方案,同时留下与变化的条件相关的其他交互未经测试。我们引入了 ProactiveVLA,它使用主动环境探索来获取可重用的知识以适应部署时间。完成初始任务后,智能体将剩余的交互预算分配给自我提出的目标,包括对象可供性、状态改变交互和交互组合。它验证执行结果,并将任务导向和探索经验整合到记忆中,指导后续规划和控制。在 LIBERO-Pro 和 RoboCasa365 Composite-Seen 上相同的回合预算下,ProactiveVLA 的性能优于基线。在 LIBERO-Pro Goal-T 上,评估期间最多允许一次 VLA 原语调用,ProactiveVLA 完成了 48% 的实例,而最先进的任务细化基线为 19%。

ProactiveVLA:主动探索与交互记忆增强冻结 VLA:论文原图
图 1:ProactiveVLA 概述。完成环境提供的任务后,智能体使用剩余的交互预算来探索场景相关的目标,包括对象可供性、状态改变交互和交互组合。独立的视觉检查员评估探索结果并为继续探索提供反馈。 记忆管理层保留完整的交互记录,组织场景内的经验,综合跨场景的知识,并独立审查候选规则。接受的规则形成一个冻结的全局记忆,指导跨任务和变体的执行。