论文

SimpleMemVLA:用于视觉-语言-动作模型的简单但有效的本机视频内存

SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models

上下文与知识上下文工程

摘要

长期操纵是部分可观察的:选择下一步行动所需的信息可能只出现在几分钟前的观察中。现有的记忆机制:检索库、学习压缩器、循环状态必须在知道未来的决定需要什么之前决定从过去保留什么。其动机是假设分钟尺度的历史太大而无法直接处理,而现代 VLM 主干网络已不再支持这一假设。在这项工作中,我们引入了 SimpleMemVLA,一种没有专用内存模块的 VLA。它保持采样历史记录完整,并以带时间戳的视频格式将其传递到骨干网,骨干网经过预先训练以进行处理;然后,生成的子任务的隐藏状态形成从历史记录到标准流程匹配动作头的唯一通道。由于连续决策共享大部分历史记录,因此在操作执行期间预填充共享前缀可以使延迟接近单帧 VLA。 SimpleMemVLA 在四个内存基准上树立了新的技术水平,而无需通用控制成本。保持主干和训练设置固定,它的性能大大优于检索、压缩和循环状态机制,并且因果干预证实该策略真正读取了其历史。代码可在 https://github.com/wadeKeith/SimpleMemVLA 获取