论文
Trifuse:通过多模态融合增强基于注意力的 GUI 定位
Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion
摘要
GUI 定位将自然语言指令映射到正确的界面元素,是 GUI 智能体的感知基础。现有方法主要依赖使用大规模 GUI 数据集微调多模态大语言模型(MLLM)来预测目标元素坐标,这既耗费数据,又难以泛化到未见过的界面。近期基于注意力的替代方案无需任务特定微调即可利用 MLLM 注意力机制中的定位信号,但由于 GUI 图像中缺乏显式且互补的空间锚点,可靠性较低。针对这一局限,我们提出 Trifuse,一个显式整合互补空间锚点的基于注意力的定位框架。Trifuse 通过 Consensus-SinglePeak(CS)融合策略整合注意力、OCR 衍生的文本线索与图标级描述语义,该策略在强制跨模态一致的同时保留锐利的定位峰值。在四个定位基准上的大量评估表明,Trifuse 无需任务特定微调即可取得强劲性能,大幅降低对昂贵标注数据的依赖。此外,消融研究显示,引入 OCR 与描述线索在不同骨干上一致提升基于注意力的定位性能,凸显其作为通用 GUI 定位框架的有效性。
