论文

RoboMME-Interference:干扰下机器人内存基准测试

RoboMME-Interference: Benchmarking Robot Memory Under Interference

模型评测基准与评测资源

摘要

部署在现实环境中的机器人将在部署过程中积累许多会话和任务的经验。机器人的任务通常可能需要它记住之前多个会话的信息,这使得长上下文机器人记忆对于现实世界的部署非常重要。然而,当今大多数机器人记忆基准测试都是基于单个事件或简短的上下文。为了衡量当前机器人记忆系统在干扰较多的较长会话中的表现,我们引入了 RoboMME-Interference,这是一个基于 RoboMME 构建的跨会话基准(Dai 等人,2026)。对于每个查询片段,我们使用查询的相关先前演示构建会话历史记录,然后是受控数量的不相关会话,我们将其提供给 VLA 作为内存并测量准确性。通过此基准运行未经修改的 RoboMME 已发布的记忆增强 $π_{0.5}$ 变体,我们发现,虽然感知记忆变体在没有任何干扰因素的情况下可以提高成功率,但随着不相关会话的积累,它们会强烈而稳定地衰减。子目标变体使用视觉语言模型读取历史并将书面子目标传递给策略,在最好的情况下改进较少,但随着干扰因素的积累而保持更多的改进。向最强的感知变量添加检索步骤,选择在视觉上与机器人当前视图最相似的历史部分,并仅将该部分传递给策略,从而恢复其在每个干扰级别的无干扰成功率。在这个版本中,我们强调了长上下文记忆和抗干扰鲁棒性的重要性,并表明当前的系统在这些功能上基本上失败了。项目页面、视频、代码和数据位于 https://robotmemorybench.com。