论文
TIES:结合层间排序一致性削减VLA视觉词元
Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models
摘要
视觉语言动作(VLA)模型处理密集视觉词元,导致机器人操作推理延迟较高。既有词元削减通常按注意力大小静态选择,但高注意力词元的作用取决于任务,甚至可能降低策略表现。TIES以层间词元排序一致性指导动态选择,自适应结合注意力大小与排序一致性,无需额外训练。在CogACT与SIMPLER评测中,平均成功率提高6%,词元用量减少78%,并在不同解码器和评测中验证泛化表现。