论文

Trifuse:通过多模态融合增强基于注意力的 GUI 定位

Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion

智能体系统Agent 环境交互

摘要

GUI 定位将自然语言指令映射到正确的界面元素,是 GUI 智能体的感知基础。现有方法主要依赖使用大规模 GUI 数据集微调多模态大语言模型(MLLM)来预测目标元素坐标,这既耗费数据,又难以泛化到未见过的界面。近期基于注意力的替代方案无需任务特定微调即可利用 MLLM 注意力机制中的定位信号,但由于 GUI 图像中缺乏显式且互补的空间锚点,可靠性较低。针对这一局限,我们提出 Trifuse,一个显式整合互补空间锚点的基于注意力的定位框架。Trifuse 通过 Consensus-SinglePeak(CS)融合策略整合注意力、OCR 衍生的文本线索与图标级描述语义,该策略在强制跨模态一致的同时保留锐利的定位峰值。在四个定位基准上的大量评估表明,Trifuse 无需任务特定微调即可取得强劲性能,大幅降低对昂贵标注数据的依赖。此外,消融研究显示,引入 OCR 与描述线索在不同骨干上一致提升基于注意力的定位性能,凸显其作为通用 GUI 定位框架的有效性。

Trifuse:通过多模态融合增强基于注意力的 GUI 定位
图2:我们的Trifuse框架概览。Trifuse由三个主要组件组成:(1) 模态提取模块,用于导出互补的定位线索,包括来自MLLM的基于注意力的信号、来自OCR的文本线索,以及来自图像描述的图标级视觉语义;(2) Consensus-SinglePeak(CS)融合模块,通过联合建模跨模态一致性和模态特定的判别性峰值来整合这些模态特定的热力图;以及(3) 两阶段定位模块,通过裁剪和放大操作逐步细化融合后的定位图,以准确识别目标GUI元素。