论文

AQuaUI:基于自适应四叉树的GUI智能体视觉token缩减

AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees

模型推理推理加速

摘要

大型多模态模型(LMM)近来已成为GUI智能体模型颇具前景的骨干网络,其中每次迭代步骤都会将高分辨率GUI截图引入提示中。然而,这些截图呈现出高度不均匀的空间信息密度:大片区域可能信息量很少且视觉上同质,而关键文本和图标可能需要高视觉保真度。现有解决方法要么需要额外训练,要么依赖基于注意力的token压缩,忽视了GUI截图的结构化布局与空间冗余。为填补这一空白,本文提出AquaUI,一种免训练、推理时的GUI智能体模型token缩减方法,利用截图中不均匀的信息密度。AQuaUI在每张截图输入上构建自适应四叉树,并为四叉树的每个叶节点保留一个代表性的合并token。AQuaUI在整个流水线中保留被保留token的空间位置,确保所有位置编码阶段保持一致。为进一步提升多步GUI交互中的时序一致性,我们提出一种条件四叉树算法,利用单次请求中连续截图之间的连续性。具体而言,它以先前的四叉树为参照来精化当前四叉树,有助于在静态或轻微变化的GUI状态间保留细粒度区域。我们在最先进的GUI智能体模型上实现AQuaUI,并在标准定位(grounding)与导航基准上进行实验。AQuaUI持续展现出优于先前基线的准确率-效率权衡。值得注意的是,在GUI-Owl-1.5-32B-Instruct上,AQuaUI实现高达13.22%的加速和29.52%的视觉token减少,同时保留全token性能的99.06%,表明GUI截图的空间冗余可以在推理时加以利用而无需重新训练。

AQuaUI:基于自适应四叉树的GUI智能体视觉token缩减:论文配图
图 1:AQuaUI 整个流程的概述。给定 GUI 屏幕截图,AQuaUI 将首先构建自适应四叉树来捕获 UI 布局。对于该四叉树中的每个叶节点,除了一个代表性标记之外的所有标记都被丢弃。这些代表性标记连同其最终输出的位置信息被发送到语言模型。此外,我们设计了一种条件四叉树细化算法,在构建四叉树时重用以前的屏幕截图以保持令牌一致性。