论文

LIFD:机器人操作中 3D 感知场景记忆的锚定扩散

LIFD: Anchored Diffusion for 3D-Aware Scene Memory in Robotic Manipulation

摘要

在操纵过程中,机器人和场景运动可以将先前观察到的区域移动到相机视野之外。几何感知 RGB 特征对可见结构进行编码,而部分可观察性下的控制则需要场景记忆,将观察历史和当前证据中推断的内容结合起来。我们引入 \lifd{}(Look、Imagine、Focus 和 Do),这是一个持久的、3D 感知场景记忆的框架。 LIFD 通过多视图协议学习场景标记,然后使用修正流从单个 RGB 视图和循环内存中完成它们。锚引导的交叉注意力将生成锚定到当前的几何感知特征,而紧凑的槽特征决定了视觉运动策略。表示学习过程中使用多视图和几何监督;部署需要一台 RGB 摄像头、本体感知和任务指令。 LIFD(分阶段)在 LIBERO 上达到 91.6% 的平均成功率,在 MetaWorld 上达到 79.8% 的平均成功率,比联合训练提高 LIBERO 平均成功率 11.1 个百分点。经过每个系列 10 次演示的策略头调整后,LIFD 在四个 UR5e 任务系列中实现了 56.0% 的平均成功率,而 OpenVLA-7B 的平均成功率为 40.5%。