论文

足够快的行动:低延迟机器人 VLM 和 VLA 的时空视觉词元合并

Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs

模型推理推理加速

摘要

视觉语言模型和视觉语言动作模型赋予机器人前所未有的能力。然而,视频和高分辨率图像的输入会产生大量的视觉标记,导致推理延迟极高,严重阻碍机器人的实时控制。为了突破这个计算瓶颈,我们提出了 ST-Merge,这是一种即插即用的 无需训练 框架,可以在视觉编码阶段直接有效地融合冗余标记。通过显式构建3D时空坐标,采用多队列并行匹配和加权聚合机制,实现跨帧冗余词元的高效且几何一致的融合。此外,我们引入了合并后位置校正机制,通过动态重新评估视觉词元加权质心的旋转位置代码,有效消除合并带来的空间偏差,从而保证灵巧操作所需的高精度空间感知。在主流 VLM Qwen2.5-VL 上的视频问答任务中,ST-Merge 实现了 2$\times$ 的推理加速,而精度仅损失了 1\%。当部署在 $π_{0.5}$ VLA 策略上时,ST-Merge 在 1024 $\times$ 1024 分辨率下实现了 8.3$\times$ 加速,并与此高分辨率设置下的基线成功率相匹配。在较低的分辨率下,精度会略有下降。