论文
MEMOBench:机器人操作的进程级内存基准
MEMOBench: A Process Level Memory Benchmark for Robotic Manipulation
摘要
机器人操纵通常需要对不再可见的信息采取行动,但当当前的观察在很大程度上决定下一步行动时,通常会评估视觉-语言-行动策略。现有的机器人记忆基准暴露了这一差距,但它们仍然主要依赖于最终任务的成功,因此将遗忘与操作失败混为一谈。我们提出 \textbf{MEMOBench},这是机器人操作中进程级内存评估的基准。 MEMOBench 包括 30 个历史相关任务、1{,}500 个专家演示以及来自 84 个模板的 4{,}200 个可执行检查点实例。每个检查点将粗略到精细的语言与模拟器谓词配对,并标记一个内存操作:存储、更新或压缩。这些注释定义了内存存储率、内存更新率和内存压缩率,用于衡量任务成功与否的内存保真度。在标准和内存增强 VLA 策略中,最强的内存模块基准仅达到 31.9% 的平均成功率,并且高存储通常与较弱的更新和压缩共存。检查点语言还监督语义、对比和框架内存对齐目标,在不同的内存操作中产生适度的收益。 MEMOBench 为基于内存的机器人策略提供诊断评估套件和训练监督。该项目页面位于 https://github.com/Collab-Gen/MEMOBench。