论文

ETA-VLA:通过视觉-语言-动作模型的时间融合和 LLM 内部稀疏化实现高效词元适应

ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models

模型优化稀疏化

摘要

将视觉-语言-动作(VLA)模型集成到自动驾驶系统中,为解释复杂场景和执行控制命令提供了统一的框架。然而,为了准确的时间推理而合并历史多视图帧的必要性会带来严重的计算负担,这主要是由 大语言模型 (LLM) 中自注意力机制的二次复杂性驱动的。为了缓解这一瓶颈,我们提出了 ETA-VLA,一种用于 VLA 模型的高效词元适配框架。 ETA-VLA 处理过去的 $n$ 帧多视图图像,并引入了一种新颖的 Intra-LLM 稀疏聚合器 (ILSA)。 ILSA 从人类驾驶员注意力分配中汲取灵感,在文本查询和时间一致性的指导下动态识别和修剪冗余视觉标记。具体来说,我们利用文本引导的评分机制以及保留多样性的稀疏策略来选择关键标记的稀疏子集,确保对驾驶场景的全面了解。 NAVSIM v2 上的大量实验表明,ETA-VLA 的驾驶性能可与最先进的基线相媲美,同时将计算 FLOP 减少约 32%。值得注意的是,我们的方法修剪了 85% 的视觉标记,并将推理 FLOP 减少了 61%,但在 NAVSIM v2 基准上仍然保留了 94% 的原始精度。