论文
反射:为反应关键操作启用快速和预测性的视觉-语言-动作模型
Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation
摘要
视觉-语言-动作(VLA)模型最近在机器人操作方面取得了令人鼓舞的性能。然而,现有的基准主要评估静态操作任务的泛化能力,而很大程度上忽略了动态交互场景。为了解决这一差距,我们推出了 ReflexBench,这是反应关键操作的基准。 ReflexBench 包含六个动态任务,并引入了一个评估框架,该框架将模拟器步进与机器人控制解耦,同时支持同步和异步推理下的可配置延迟。在 ReflexBench 的基础上,我们提出了 ReflexVLA,这是一种高效的 VLA 模型,专为反应关键操作而设计,无需大规模机器人数据预训练。 ReflexVLA 通过视觉主干内的潜在未来预测和多帧时间融合增强时间推理,同时通过批量视觉编码和 CUDA 图形重播减少部署延迟。实验表明,ReflexVLA 不断提高动态操纵性能,同时在标准静态操纵基准上保持有竞争力的准确性,而真实世界的实验进一步证明了其在实际部署条件下的有效性。项目网站:https://reflexvla.github.io