论文

TurboVLA:在具有 <1 GB VRAM 的 RTX 4090 上以 32 Hz 运行的实时视觉-语言-动作模型

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

模型优化小模型/轻量模型

摘要

视觉-语言-动作 (VLA) 模型通常采用以 LLM 为中心的 $V \to L \to A$ 路径,在预测机器人动作之前通过 大语言模型 处理视觉观察和语言指令。虽然有效,但这种设计会产生大量的计算和内存开销。在这项工作中,我们介绍了 TurboVLA,这是一种基于直接 $V + L \to A$ 映射构建的紧凑 VLA 架构。 TurboVLA 没有使用 大语言模型 作为感知和动作之间的中央接口,而是独立编码视觉观察和语言指令,通过轻量级双向视觉语言交互直接在它们之间交换信息,并使用紧凑解码器预测连续动作块。这种简单的设计直接构建任务条件表示,同时避免了以 LLM 为中心的执行路径的开销。在 LIBERO 上,TurboVLA 在消费级 RTX 4090 上仅用 0.2B 参数、31.2 毫秒推理延迟和 0.9 GiB 推理 VRAM 即可实现 97.6% 的平均成功率。值得注意的是,0.4B TurboVLA 在 RoboTwin 2.0 上实现了 88.06% 的成功率,甚至匹配或优于更大的 VLA 策略。这些结果表明,TurboVLA 的简单 $V + L \to A$ 设计可以实现高性能,而不需要以 LLM 为中心的执行路径,为如何连接视觉、语言和动作以实现高效的机器人操作提供了新的视角。代码可在 https://github.com/H-EmbodVis/TurboVLA 获取。