论文

修剪地点和方式:GUI智能体 导航视觉标记修剪的实证研究

Where and How to Prune: An Empirical Study of Visual Token Pruning for GUI Agent Navigation

模型推理推理加速

摘要

近年来,GUI智能体在导航任务中表现出了强大的潜力。然而,保留完整的历史屏幕截图会带来大量的计算开销。本文研究了词元剪枝这种即插即用的推理加速技术如何有效地应用于 GUI智能体 导航场景。首先,我们解决应该在哪里进行修剪的问题。我们发现了现有方法忽略的系统级冗余:由于相同的屏幕截图在不同步骤中重复输入到模型中,因此每次都会冗余地重新计算其 ViT 编码。我们证明,其 ViT 编码的嵌入可以完全缓存并跨步骤重用,从而在保持模型性能的同时显着减少 FLOP。这一发现表明推理加速工作应集中在后续的 大语言模型 (LLM) 上。在此基础上,我们进一步解决了如何在 LLM 中进行修剪的问题,并提炼出两个关键见解:(i)从语义角度来看,词元预算 应该在前景和背景区域之间保持平衡; (ii)从空间角度来看,应保持保留标记的空间均匀性,以保持模型的全局空间感知。这些发现为 GUI智能体 导航的推理加速和词元修剪的设计提供了实用指导。