论文

屏幕到动作缺了什么?迈向多模态GUI推理的UI-in-the-Loop范式

What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI Reasoning

智能体系统Agent 环境交互

摘要

现有的图形用户界面(GUI)推理任务仍然充满挑战,尤其是在UI理解方面。当前方法通常依赖基于屏幕的直接决策,既缺乏可解释性,又忽视了对UI元素的全面理解,最终导致任务失败。为了增强对UI的理解与交互,我们提出一种名为UI-in-the-Loop(UILoop)的创新GUI推理范式。我们的方法将GUI推理任务视为一个由屏幕、UI元素到动作的循环过程。通过让多模态大语言模型(MLLM)显式学习关键UI元素的定位、语义功能与实际用法,UILoop实现了精确的元素发现并执行可解释的推理。此外,我们引入了一个以UI元素为中心、更具挑战性的UI Comprehension任务,并配有三个评估指标。与之对应,我们贡献了一个包含26K样本的基准(UI Comprehension-Bench),以全面评估现有方法对UI元素的掌握程度。大量实验表明,UILoop实现了最先进的UI理解性能,同时在GUI推理任务中取得了更优的结果。

屏幕到动作缺了什么?迈向多模态GUI推理的UI-in-the-Loop范式:论文配图
图 1:左:对现有 UI 元素定位、语义功能描述和实际使用方法的评估。中:与没有 UI 信息相比,使用正确与误导性 UI 信息的性能提升。右图:UILoop 与现有“Screen-to-Action”方法在 Android Control-High SR 指标上的比较。