论文

Latent Bridge:用于高效双系统视觉-语言-动作模型推理的特征增量预测

Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference

模型推理推理加速

摘要

双系统视觉-语言-动作 (VLA) 模型实现了最先进的机器人操作,但受到 VLM 主干的瓶颈,VLM 主干必须在每个控制步骤执行,同时产生暂时冗余的特征。我们提出了 Latent Bridge,这是一种轻量级模型,可以预测时间步之间的 VLM 输出增量,使操作头能够对预测的输出进行操作,而仅定期调用昂贵的 VLM 主干。我们在两个架构不同的 VLA 上实例化潜在桥:GR00T-N1.6(特征空间桥)和 π0.5(KV 缓存桥),证明该方法可以推广到 VLA 设计。我们与任务无关的 DAgger 训练管道无需修改即可跨基准传输。在四个 LIBERO 套件、24 个 RoboCasa 厨房任务和 ALOHA sim 传输立方体任务中,Latent Bridge 实现了 95-100% 的性能保留,同时将 VLM 调用减少了 50-75%,每集净加速达到 1.65-1.73 倍。