论文
EvoMem-VLA:用于长视野机器人操作的状态演化记忆
EvoMem-VLA: State-Evolution Memory for Long-Horizon Robot Manipulation
摘要
大多数视觉-语言-动作 (VLA) 模型依赖于当前的观察结果,一旦离开视图就会丢失与任务相关的证据,从而限制了长期、依赖于记忆的任务的性能。现有的工作结合了压缩的历史特征或稀疏的视觉关键帧。然而,孤立的快照可能会让策略不确定过去交互期间发生了什么变化以及应该采取哪些操作。为了克服这个限制,我们提出了 EvoMem-VLA,它通过显式编码和保留历史状态之间观察到的变化来构造状态演化记忆。这些变化表示保留了交互结果的证据,使策略能够跟踪孤立快照之外的任务进度。具体来说,我们引入条件增量分词,将有序帧对编码为定向、源条件增量token,每个增量都与其相应的状态证据相关联。共享VLM骨干模型支持任务自适应路由:正常的长期任务遵循直接操作路线,而多阶段任务使用子任务路线,生成可执行子任务作为操作生成的附加输入。通过针对每个模拟基准进行单一联合训练的策略,EvoMem-VLA在 RMBench 上实现了 80.7% 的成功率,在 RoboMME 上实现了 82.0% 的成功率,在跨越两个机器人实施例的四个现实世界任务中实现了 83.8% 的成功率。这些结果代表了所有三种评估设置相对于先前技术水平的显着改进。
