论文
AQuaUI:基于自适应四叉树的GUI智能体视觉token缩减
AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees
摘要
大型多模态模型(LMM)近来已成为GUI智能体模型颇具前景的骨干网络,其中每次迭代步骤都会将高分辨率GUI截图引入提示中。然而,这些截图呈现出高度不均匀的空间信息密度:大片区域可能信息量很少且视觉上同质,而关键文本和图标可能需要高视觉保真度。现有解决方法要么需要额外训练,要么依赖基于注意力的token压缩,忽视了GUI截图的结构化布局与空间冗余。为填补这一空白,本文提出AquaUI,一种免训练、推理时的GUI智能体模型token缩减方法,利用截图中不均匀的信息密度。AQuaUI在每张截图输入上构建自适应四叉树,并为四叉树的每个叶节点保留一个代表性的合并token。AQuaUI在整个流水线中保留被保留token的空间位置,确保所有位置编码阶段保持一致。为进一步提升多步GUI交互中的时序一致性,我们提出一种条件四叉树算法,利用单次请求中连续截图之间的连续性。具体而言,它以先前的四叉树为参照来精化当前四叉树,有助于在静态或轻微变化的GUI状态间保留细粒度区域。我们在最先进的GUI智能体模型上实现AQuaUI,并在标准定位(grounding)与导航基准上进行实验。AQuaUI持续展现出优于先前基线的准确率-效率权衡。值得注意的是,在GUI-Owl-1.5-32B-Instruct上,AQuaUI实现高达13.22%的加速和29.52%的视觉token减少,同时保留全token性能的99.06%,表明GUI截图的空间冗余可以在推理时加以利用而无需重新训练。
