论文
NativeMEM:用于长视野机器人操作的本机内存压缩
NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation
摘要
预训练的视觉-语言-动作 (VLA) 模型如何在不牺牲效率的情况下通过高频更新保留长期视觉历史?现有方法依赖于外部内存管理,这限制了内存范围或预训练策略的反应性。为此,我们提出了 NativeMEM,一种具有长期、实时更新内存的 VLA 策略。其核心是一种高效的内存编码方案,即本机内存压缩,它重新利用了 VLA 自己的视觉编码器,将每个摄像机视图中的每个历史帧压缩为单个词元。这些内存词元附加到输入序列中,使预训练的 VLA 能够以可忽略的延迟开销参与长期历史记录,既不需要外部规划器,也不需要新初始化的内存模块。为了使内存词元与预训练策略保持一致,我们首先在内存需求数据上的冻结 VLA 的监督下开发通用内存词元生成器,然后为特定于任务的 微调 解冻 VLA。 NativeMEM 始终优于之前的方法,将模拟成功率从 32.4% 提高到 84.0%,将真实机器人的成功率提高到 98.7%,同时保持较低的推理延迟和 GPU 内存使用率。值得注意的是,NativeMEM 仅使用 20% 的训练数据就取得了与现有技术竞争的结果,展现了高数据效率。