论文

StateMem:具有视觉-语言-动作策略自适应推理的单状态残留记忆

StateMem: Single-State Residual Memory with Adaptive Inference for Vision-Language-Action Policies

上下文与知识上下文工程

摘要

依赖于记忆的机器人操作通常需要稍后的操作才能使用早期交互中的信息。现有的视觉-语言-行动(VLA)政策主要依赖于当前的观察,限制了历史信息的保留。内存增强的 VLA(例如 MemoryVLA)通过外部存储体解决了这一限制,但需要显式存储和检索。为了解决这些限制,我们提出了 StateMem,这是一种用于 VLA 策略的单状态残差内存框架,它使用预测误差通过低秩残差来更新持久内存词元,并自适应地路由缓存的前缀。免训练控制器在线调整路由阈值,同时快速校正在缓存重用期间补偿过时的前缀特征。我们在 LIBERO、RoboMemArena 和现实世界的操作任务上评估 StateMem。在 LIBERO 上,StateMem 的平均成功率达到 97.6%,相对于完全刷新,平均 VLM 前缀刷新率降低了 20.25%。在 RoboMemArena 的 Occlusion 类别中,StateMem 在单 VLA 方法中取得了最佳性能,达到 21.8% 的任务成功率(TSR)和 44.3% 的累积成功率(CSR)。在六项现实世界的操作任务中,它的平均成功率达到了+21%。