论文
了解视觉-语言-动作模型的异步推理方法
Understanding Asynchronous Inference Methods for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型为通用机器人控制提供了一条有希望的途径,但当异步执行生成的动作时,它们的推理延迟会导致观察陈旧。为了缓解这个问题,人们同时提出了几种方法:推理时间修复(IT-RTC)、训练时间延迟模拟(TT-RTC)、未来状态感知调节(VLASH)和轻量级残差校正(A2C2)。每个方法都采用根本不同的方法,但到目前为止,它们已经使用不同的代码库、基本策略和协议进行了独立评估。我们在受控条件下对这四种方法进行了系统比较。我们开发了两个统一的代码库,将所有方法与统一的库和数据集版本集成在一起,并在具有 MLPMixer 策略的 Kinetix 套件和具有 SmolVLA 的 LIBERO 操作基准上对它们进行基准测试,将推理延迟扫除高达 $d=20$ 控制步骤。 A2C2 的每步残差校正是 Kinetix 上最有效的方法,在 $d=8$ 之前保持 90% 以上的解决率,并且从 $d=4$ 开始在 LIBERO 上也领先。 IT-RTC 在低延迟下具有竞争力,但在长块($H=30$)和高延迟下急剧退化。 TT-RTC 是最稳健的基于训练的方法:在 $d_\max$ 选择中保持稳定,概括超出其训练延迟分布,并增加零推理开销。 VLASH 表现出明显的低延迟与高延迟权衡,受 微调 延迟范围 $[0,d_\max]$ 控制。代码可在 https://github.com/TheAyos/async-vla-inference 获取