论文

VLA-InfoEntropy:用于视觉-语言-动作模型推理加速和成功的 无需训练 视觉-注意信息熵方法

VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success

模型推理推理加速

摘要

视觉-语言-动作(VLA)模型集成了视觉感知、语言理解和动作决策,以实现跨模态语义对齐,展现出广泛的应用潜力。然而,高维视觉特征、复杂语言输入和连续动作序列的联合处理会带来巨大的计算开销和低推理效率,从而阻碍实时部署和可靠性。为了解决这个问题,我们使用图像熵来量化每个视觉标记的灰度分布特征,并引入注意力熵来捕获任务相关文本上的注意力分数的分布。视觉熵识别纹理丰富或结构信息丰富的区域,而注意力熵则精确定位语义相关的标记。与时间步长信息相结合,这些指标可以实现动态转换策略,将模型的焦点从全局视觉特征转移到注意力引导的局部信息区域。因此,所得的 VLA-InfoEntropy 方法集成了空间、语义和时间线索,以减少冗余,同时保留关键内容。大量实验表明,我们的方法减少了推理参数,加快了推理速度,并且优于现有方法。