论文
补丁策略:通过密集的视觉表示进行有效的具体控制
Patch Policy: Efficient Embodied Control via Dense Visual Representations
摘要
Vision Transformer (ViTs) 的预训练密集视觉特征非常强大,但在机器人学习中尚未得到充分利用。现代机器人策略要么将每个观察结果压缩为单个全局标记,要么依赖于从头开始训练的视觉主干,从而牺牲了细粒度的空间细节和大规模视觉 预训练 的好处。虽然存在确实对大型视觉语言动作模型(VLA)等密集补丁特征进行操作的策略,但它们往往笨重且缓慢,继承了十亿参数视觉语言模型(VLM)主干的全部成本。我们通过补丁策略弥补了这一差距,这是一个最小的架构扩展,使基于 Transformer 的策略能够直接使用密集的预训练补丁词元,而无需完整 VLM 的计算开销。其核心是一个块因果注意力掩模,它保留了标准策略的时间因果关系,同时让模型参与每个观察的许多补丁标记以及其他状态信息。补丁策略轻量、快速且高效。在四个模拟环境套件和三个真实环境套件中,我们的方法比使用最先进的全局池表示的策略实现了 40% 的相对改进。此外,它比微调后的 OpenVLA-OFT 提高了 18%,同时使用了大约 0.7% 的参数。我们相信补丁策略为机器人社区提供了一个管道,可以轻松利用视觉表示学习的持续进步,而不会牺牲高频反应控制所需的训练效率或推理速度。视频可以在 https://patch-policy.github.io 观看