论文
解耦视觉、语言和动作以实现高效的多任务机器人策略
Decoupling Vision, Language, and Action for Efficient Multi-Task Robot Policies
摘要
视觉语言动作 (VLA) 策略通常在每次策略推理时运行具有数十亿个参数的视觉语言模型 (VLM) 主干网,这会消耗延迟和能源。我们重新审视多任务操作的解耦替代方案:独立的视觉和语言编码器,其表示条件是紧凑的动作头。我们进行标准化比较,改变视觉编码器、语言编码器和动作头,同时根据七个 VLA 基线固定演示、训练步骤预算、任务、评估协议和测量平台。由此产生的解耦实施模型 (DEM) 结合了微调的 DINOv3 视觉编码器、冻结的 NeoBERT 语言编码器和在一次前向传递中生成动作块的 MeanFlow 头。在使用保留指令释义和随机场景评估的 18 个 RoboCasa 任务中,DEM 达到 55.6% 平均成功率,而 GR00T N1.7 为 56.9%,$π_{0.5}$ 为 54.6%;在三个真实机器人任务中,它达到 66.0%,而 GR00T N1.7 为 68.0%。在同一工作站上,DEM 每个策略前向传递需要 6.1ms,最大吞吐量为每秒 162.7 个策略调用,每次调用估计消耗 2.07J 的 GPU 能量,吞吐量是这些 VLM 主干策略的 8 到 17 倍,能源少 6 到 15 倍。在这个经过训练的任务体系中,DEM 位于观察到的成功-延迟-能量前沿,并为语言条件机器人技能提供了强大、高效的基线。