论文
视觉-语言-动作模型中词元压缩的显着差异建模
Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models
摘要
词元压缩已成为降低大型基础模型推理成本的关键技术,词元修剪和 KV 缓存重用等方法在视觉语言模型中广泛采用,并且最近在实体代理中进行了探索。在具体代理中,词元不仅支持感知和语义理解,而且直接影响延迟敏感的闭环机器人动作预测。现有方案通常使用冗余或重要性线索(例如视觉相似性、注意力分数和显着性)来指导压缩。然而,这些线索只能间接衡量安全压缩的关键因素:在导致下游操作出现不可接受的偏差之前,词元可以改变多少。这种与接收者相关的容差与公正显着差异(JND)原理密切相关。经典 JND 描述了人类视觉系统中的信号容差,而面向机器的 JND 将这一概念扩展到下游机器响应。在此进展的基础上,我们引入了 Action-JND,它将 JND 建模扩展到具体感知,通过闭环控制中视觉-语言-动作 (VLA) 策略的语言条件动作响应来定义引人注目性。仅当引起的动作偏差保持在可容忍的范围内时,词元更改才被认为是可接受的。为了实现这个概念,我们在深度视觉特征空间中开发了一个轻量级的 token-wise JND 估计器,以预测最大可容忍扰动,同时保留政策响应。由此产生的动作容忍分数作为 VLA 压缩范例的即插即用标准,包括过时的 KV 重用和词元修剪,优先考虑动作容忍词元进行压缩。使用 OpenVLA 和 OpenVLA-OFT 在 LIBERO 基准上进行的实验表明,Action-JND 持续提高了压缩可靠性,尤其是在激进的压缩比下。