论文

ST-Prune:自动驾驶视觉语言模型的 无需训练 时空词元修剪

ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving

摘要

视觉语言模型 (VLM) 已成为自动驾驶系统的核心,但其部署因多视图相机和多帧视频输入的大量计算开销而受到严重瓶颈。现有的词元修剪方法主要针对单图像输入而设计,单独处理每个帧或视图,因此无法利用驾驶场景中固有的时空冗余。为了弥补这一差距,我们提出了 ST-Prune,一种 无需训练 即插即用框架,包含两个互补模块:运动感知时间修剪(MTP)和环视图空间修剪(RSP)。 MTP 通过将运动波动性和时间新近度编码为多样性选择目标中的软约束来解决时间冗余问题,优先考虑动态轨迹和当前帧内容而不是静态历史背景。 RSP 通过利用环视图相机几何形状来惩罚双边交叉视图相似性,从而进一步解决空间冗余问题,从而消除仅靠时间修剪无法抑制的重复投影和残留背景。这两个模块共同构成了完整的时空剪枝过程,在严格压缩下保留关键场景信息。 ST-Prune 经过感知、预测和规划等四个基准的验证,为 无需训练 词元修剪建立了新的最先进技术。值得注意的是,即使词元减少了 90%,ST-Prune 也能实现近乎无损的性能,某些指标超过了全模型基线,同时保持了与现有修剪方法相当的推理速度。