论文
GUITrans2Act:经视觉语言模型从移动GUI交互理解用户操作行为
GUITrans2Act: Understanding User Operational Behaviors from Mobile GUI Interactions with Vision-Language Models
摘要
理解移动设备上的数字世界正在从静态 UI 感知转变为动态动作理解。此功能使模型能够将视觉状态转换转换为操作知识,操作知识被定义为描述操作类型、目标 UI 元素、文本参数和执行顺序的简短自然语言句子。然而,由于跨应用程序的 UI 设计高度多样化和异构,现有的视觉语言模型 (VLM) 难以准确推断这些底层操作。为了弥补这一差距,我们引入了 Teach VLM,这是一种核心模型,旨在通过从演示视频中提取和分析与操作相关的关键帧,将移动屏幕轨迹转化为逐步的操作知识。为了解决对齐训练数据的稀缺问题,我们开发了用于可扩展数据采集的系统数据飞轮。我们进一步引入了一种新颖的中文移动屏幕教学基准来进行细粒度的评估。在 Teach VLM 的基础上,我们提出了 Teach-and-Repeat 范式,其中生成的操作知识作为可解释的程序参考来指导下游基于屏幕的执行代理。广泛的评估表明,Teach VLM 的性能显着优于强大的 VLM 基线,在操作语义预测方面实现了最先进的性能。此外,Android World 中的实验表明,我们的范例为下游代理带来了一致的任务成功率提高。 Teach VLM 和 Teach-and-Repeat 范例共同提供了从原始演示到可重用任务自动化的实用途径。
