论文
屏幕到动作缺了什么?迈向多模态GUI推理的UI-in-the-Loop范式
What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI Reasoning
摘要
现有的图形用户界面(GUI)推理任务仍然充满挑战,尤其是在UI理解方面。当前方法通常依赖基于屏幕的直接决策,既缺乏可解释性,又忽视了对UI元素的全面理解,最终导致任务失败。为了增强对UI的理解与交互,我们提出一种名为UI-in-the-Loop(UILoop)的创新GUI推理范式。我们的方法将GUI推理任务视为一个由屏幕、UI元素到动作的循环过程。通过让多模态大语言模型(MLLM)显式学习关键UI元素的定位、语义功能与实际用法,UILoop实现了精确的元素发现并执行可解释的推理。此外,我们引入了一个以UI元素为中心、更具挑战性的UI Comprehension任务,并配有三个评估指标。与之对应,我们贡献了一个包含26K样本的基准(UI Comprehension-Bench),以全面评估现有方法对UI元素的掌握程度。大量实验表明,UILoop实现了最先进的UI理解性能,同时在GUI推理任务中取得了更优的结果。
