论文
Track4Action:将世界坐标3D跟踪信息蒸馏到VLA策略
Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies
摘要
动作标签告诉视觉-语言-动作 (VLA) 策略,机器人命令模仿,但不告诉这些命令如何改变 3D 世界。对齐的演示剪辑包含此缺失的监督,因为其 $K$ 帧过渡记录了相应 $K$ 动作期间产生的几何形状、运动、可见性和摄像机变化。我们引入了 Track4Action,一个框架,该框架将这种从冻结的以世界为中心的 3D 跟踪器实现的转变提炼为当前观察的 VLA 策略。在训练期间,Track4World 将剪辑 $V_{t:t+K}$ 编码为池化跟踪器特征。可学习的跟踪查询从当前的 VLA 隐藏状态推断出此特征,在共享空间中进行匹配,并通过特征明智的门来调节流匹配动作头。跟踪器功能仅定义对齐目标,因此在部署时既不使用夹子也不使用跟踪器。 Track4Action 在零样本 LIBERO-Plus 上达到 82.3%,将无对齐变体提高了 7.6 点,将 LaMP 提高了 3.0 点。它在干净和随机的 RoboTwin 2.0 分割中获得 80.44% 和 81.48%,在四项物理双手任务中平均成功率为 67.5%,比无对齐变体高 25.0 分。模拟和物理任务的收益支持与动作一致的 3D 跟踪器功能,作为无跟踪器 VLA 部署的特权监督。我们的项目页面位于 https://wing0night.github.io/track4action-project-page。