论文

IMLE-VLA:视觉-语言-行动策略的快速单步行动生成

IMLE-VLA: Fast Single-Step Action Generation for Vision-Language-Action Policies

模型架构新型架构

摘要

视觉语言动作(VLA)策略利用预训练的视觉语言主干来实现强大的跨任务泛化。领先的设计将该骨干与通过扩散或流量匹配训练的专用连续动作头结合起来。然而,此类头依赖于迭代多步采样,例如 $π_{0.5}$ 中的 10 个欧拉步。这会产生推理瓶颈,导致机器人走走停停,任务完成速度变慢。我们引入了 IMLE-VLA,它用通过条件隐式最大似然估计(cIMLE)训练的单步条件生成器取代了迭代动作头。 cIMLE 目标促进多模态动作覆盖,避免朴素回归头的模式崩溃,同时完全消除多步采样。当 IMLE-VLA 应用于 $π_{0.5}$ 时,推理频率提高了 3.67 倍(55 Hz 与 15 Hz),从而使操作吞吐量提高了 11 倍。在 40 任务 LIBERO 基准上,IMLE-VLA 在所有基线中实现了最高的平均成功率 (98.0%),同时推理频率领先。在 LIBERO-plus 的测试时间扰动下,IMLE-VLA 保留了 $π_{0.5}$ 的鲁棒性,而其他基线急剧下降,证实了 cIMLE 头保留了泛化能力。在 Franka Emika Panda 上进行的四项任务的真实实验表明,IMLE-VLA 的运动更平滑(抖动降低 2.2 倍到 3.0 倍),任务完成速度更快,IMLE-VLA 在每项任务上的表现都优于 $π_{0.5}$,并将每集的平均 VLA 推理时间减少了 3.9 倍到 6.6 倍。视频和代码可在 https://kianhk6.github.io/IMLE-VLA/ 获取