论文

DynaFLIP:通过三模态动力学引导表示重新思考机器人感知

DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation

模型训练预训练

摘要

机器人操纵很大程度上取决于保留场景中与动作相关的方面的感知。然而,大多数机器人学习管道都是建立在经过预先训练的视觉编码器上,用于静态识别或视觉语言对齐,将运动理解留给下游策略。我们推出了 DynaFLIP,这是一种动态感知的多模态 预训练 框架,可将运动理解推向感知。我们从异构人类和机器人视频中构建图像语言 3D 流三元组,并使用这些三元组作为训练时监督来形成纯图像编码器。我们的关键想法是鼓励三种模态跨越共享超球面空间中的一个小的单纯形体积——较小的单纯形体积表明更强的对准。为了避免朴素体积最小化的几何模糊性和微不足道的崩溃,我们将单纯形体积最小化与余弦正则化器和对比目标结合起来。我们的分析表明,DynaFLIP 重点关注对操纵至关重要的控制相关区域。由此产生的动态感知表示可作为可重复使用的视觉主干,并始终优于各种下游策略(包括 VLA)的基线。我们在不同的模拟和现实世界设置中验证了这一点,在分布外场景下增益达到 +22.5%。我们的结果表明,当视觉表示经过训练不仅可以编码当前的内容,还可以编码世界在行动中如何变化时,机器人的泛化能力就会提高。