紧凑机器人策略需要细粒度视觉表征
Compact Robot Policies Need Fine-Grained Visual Representations
摘要
多任务操作策略在架构、规模和预训练先验方面都存在差异,因此已发布的比较不能将性能归因于任何单个组件。我们认为大部分来自视觉表征,而参数规模和生成先验在很大程度上是偶然的。为了测试这一点,我们构建了 CoRP(压缩表示策略),这是一个故意紧凑的策略(48.9M 参数,没有视觉语言模型,也没有视频生成先验),它分解为表示提取器和流匹配动作生成器。在 LIBERO 上达到 97.0%,在 RoboTwin 2.0 Clean/Randomized 上达到 75.78%/73.36%,匹配系统大 40.9-163.6 倍。保持动作生成器固定,然后我们一次改变一个提取器属性。预训练初始化是决定性的:LIBERO 上的随机 ViT-S/14 下降到 78.1%,ImageNet ResNet-34 下降到 74.5%。仅预训练是不够的,因为冻结编码器需要 19.8 个点。压缩同样重要:将每个视图重新采样为 48 个 token 击败了通过所有补丁 token(97.0% vs 83.2%),并且这些 token 上的变化信息瓶颈比严格的 token 预算更糟糕,通过抑制依赖于指令的 token 选择,将 LIBERO 目标从 95.8% 削减到 33.0% 策略依赖。语言调节仅在观察结果不明确的情况下起作用(LIBERO-目标:9.2% 至 95.8%),而在 RoboTwin 2.0 中,观察结果明确,删除它会稍微提高成功率。因此,我们认为,当其表示经过预训练、任务适应和压缩时,紧凑型策略才有效。项目页面:https://corp-policy.github.io/
