论文

AcrossVAM1.0:面向文本辅助机器人视频预测的粒子世界建模

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

摘要

预测机器人视频需要精确的运动推理和高频外观的保留,但整体像素模型使这些目标纠缠在一起,并且经常将其进度隐藏在强大的最后一帧基线后面。我们提出了 AcrossVAM1.0,这是一种轻量级的文本辅助视频动作模型,它将未来预测分解为以对象为中心的运动和密集的外观。冻结的 SAM3-DLP 编解码器将四个上下文帧分解为机器人、手臂和夹具的语义粒子,以及潜在的背景。 0.28M 参数时空 Transformer 会对齐粒子身份,向前滚动其状态,并由通过 FiLM 嵌入的冻结 OpenCLIP 指令进行调制。因果双流解码器将粒子渲染运动与仅从最后观察到的帧编码的外观相结合;剩余的精炼器和学习的传递掩模产生五个未来的框架,而无法访问未来的外观。在我们根据不同的真实机器人轨迹构建的 VRS 基准上,粒子动力学比持久性将轨迹误差减少了 21.0%。在三个传递掩模种子中,AcrossVAM1.0 将未来帧 PSNR/SSIM 从 19.97/0.796 提高到 20.573/0.8004,而原始粒子生成将运动区域 PSNR 从 11.89 提高到 13.23。交付的模型尚未击败 LPIPS 中的持久性,正确与改组的语言仅改变轨迹误差 2.8--3.1%。我们将这些限制与预言、阴性对照、多种子和每个机器人分析一起报告。结果表明,显式粒子动力学是机器人视频预测的一个有前途的低维接口,而强大的语言基础和外观传递仍然是主要的开放挑战。

AcrossVAM1.0:面向文本辅助机器人视频预测的粒子世界建模:论文配图
图2: 众议员坚持Franka的预测。每个面板显示五个未来步骤;行是参考真理、剩余投递、生化、耐久和以蓝到黄的 RGB 颜色图为视觉的学习混合面具。左边的例子具有紧凑的互动区域,而右边的例子则含有更严重的杂交和隔离。这些案件是在选定检查站后从固定种子-0演示中挑选出来的;它们不用于定量模型的选择。