论文

用于视觉-语言-动作模型中自适应 KV 缓存重用的神经内省门控

Neural Introspection Gating for Adaptive KV-Cache Reuse in Vision-Language-Action Models

模型推理KV Cache

摘要

视觉-语言-动作 (VLA) 模型通过单个自回归 Transformer 将相机图像和语言指令直接映射到运动命令。在实时控制中,他们仍然花费大量的计算来重新计算视觉标记的键值(KV)表示,这些视觉标记在相邻帧之间几乎没有变化。最近的工作(例如 VLA-Cache)通过重复使用视觉静态补丁的 KV 状态来降低成本,但其策略仅依赖于观察空间启发法,并且没有考虑模型自身的不确定性。我们提出门控 VLA-Cache,这是一种轻量级的 无需训练 扩展,可通过神经内省增强视觉相似性缓存。该方法监视前两个预测动作标记之间的 logits 裕度,这是解码期间可用的零成本置信信号。当边际降至阈值以下时,缓存将失效并触发完全重新计算。在使用 OpenVLA 和 OpenVLA-OFT 的四个 LIBERO 基准套件上进行评估后,门控 VLA-Cache 提高了盲缓存受损时的可靠性。在 LIBERO-Goal 和 LIBERO-Long 上,它恢复了超过 100% 的损失精度,同时保留了 80% 的计算节省。