论文

门,而不是缓存:门来源限制了 无需训练 VLA 词元跳过的闭环可靠性

The Gate, Not the Cache: Gate Provenance Bounds the Closed-Loop Reliability of Training-Free VLA Token Skipping

模型推理推理加速

摘要

词元跳跃是一种广泛使用的 无需训练 方法,通过根据门在每个控制步骤绕过大多数视觉词元的计算来加速视觉-语言-动作 (VLA) 模型。然而,当从前一个加速前进中收获下一个门时,在一个步骤中跳过的词元也是下一个门最不可见的词元,并且损害可能会跨控制步骤复合,直到任务失败。我们研究了此类构建的两种机制:重用和删除,将每种机制与其门信号在相同事件中的来源进行交叉。在 LIBERO-Object 上的跳跃率为 0.9 时,当门来自模型自身的加速前向时,两者都会崩溃,在重用时为 0.68,在删除时为 0.31,而密集的 1.00,并且崩溃对于我们评估的动作级检测器来说是不可见的。将崩溃与密集级操作区分开来的不是机制,而是门是否干净,由不跳过任何内容的前向计算得出。因此,我们建议驱动松弛刷新,即在机器人执行当前动作块时进行一次密集传递运行,脱离关键路径,为下一步提供一个干净的门和一个新的 KV 基础。由于测量的检测器不能可靠地揭示故障,因此刷新是无条件的而不是触发的。然后,两种机制都恢复到 0.98,保持跳跃速度和密集传递的信息。然后,我们将刷新集成到两个 VLA 策略、4 个 LIBERO 套件和 4 个 SIMPLER 任务中最先进的缓存和修剪方法中,修复因使用自收获门而导致的每次崩溃。在模拟和物理机器人上测量,服务延迟比密集型延迟降低了 18--22%。门信号来自何处,而不是如何跳过词元,决定了加速 VLA 的闭环可靠性。