论文
MIKASA-Robo-VLA:针对长视野操作的 VLA 模型中的内存基准测试
MIKASA-Robo-VLA: Benchmarking Memory in VLA Models for Long-Horizon Manipulation
摘要
视觉-语言-动作策略通常只能看到一个或几个最近的帧,这使得很难评估它们如何使用在任务过程中消失的信息。我们推出了 MIKASA-Robo-VLA,这是 90 种语言条件操作任务的基准。除了 10 个之外,所有其他都隐藏了动作所依赖的提示。这 10 个是反应性控制。它重建的套件 MIKASA-Robo 有 32 个任务,并且仅使用代表性 VLA 子集中的语言。在这里,每个任务都提供一条指令,而依赖于记忆的任务则隐藏与任务相关的提示,而反应性控制则使其保持可用。对于 70 个任务,环境阶段时序指定了信息间隙,其中 28 个任务的间隙超过了我们调查的最宽固定上下文 VLA 的 16 帧窗口。间隙仅计算提示不存在的时间间隔,而不是策略必须保留它的完整持续时间,因此每个依赖于记忆的任务仍然需要通过构建来记忆,包括那些测量间隙较短的任务。我们在 RLDS 和 LeRobotDataset v3 中发布了跨 10 种记忆类型的 22,500 个oracle轨迹。具有当前图像和本体感觉但没有观察历史或显式记忆模块的参考 $π_{0.5}$ 基线在 14 项任务上进行了微调,并实现了 0.211 $\pm$ 0.044 平均任务成功率。它在评估的Long划分任务上的成功率较低,这一比较同时受到开环动作分块和该子集记忆类型构成的混杂影响。项目页面:https://mikasarobo.github.io/