论文

KEMO:使用 VLA 策略进行长视野机器人操作的事件驱动关键帧内存

KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies

摘要

长视野机器人操作仍然具有挑战性,因为类似的观察可能发生在不同的执行阶段,而适当的动作取决于先前完成的操作。内存可以通过启用策略从执行历史推断任务进度来解决这种模糊性。然而,现有的记忆增强方法通常要么保留需要压缩的密集历史,要么主要依赖于可能丢弃早期任务相关事件的最近上下文。在这项工作中,我们提出了 KEMO,这是一种轻量级插件内存框架,可以自动选择性地保留与 VLA 策略的任务相关状态更改相关的关键帧。 KEMO 将机器人运动学与视觉过滤相结合来检测事件,将选定的关键帧编码为紧凑的时间顺序记忆标记,并通过交叉注意和门控残差融合将它们与当前的视觉特征集成以进行 VLA 训练。检测到的事件还定义了关键转变附近的更高权重的训练样本。我们在各种现实世界的双臂操作任务上评估 KEMO,这些任务涵盖 2 到 6 个评分子任务,轨迹长度范围从 830 个步骤到 2846 个执行步骤(持续时间从 28 到 95 秒)。与无记忆基线(例如 $π_{0.5}$)相比,KEMO 将总体任务成功率提高了 23.6%,阶段完成率提高了 34.1%。消融表明,事件驱动的关键帧选择优于均匀采样和最近帧保留,而提出的门控融合和关键帧对齐损失权重提供了互补的增益。