论文
Video2GUI:为广义 GUI智能体 预训练合成大规模交互轨迹
Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
摘要
多模态 大语言模型 的最新进展引起了人们对图形用户界面 (GUI) 代理的日益浓厚的兴趣,但它们的泛化仍然受到跨越不同现实世界应用的大规模训练数据的缺乏的限制。现有数据集严重依赖昂贵的手动注释,并且通常仅限于狭窄的领域。为了应对这一挑战,我们提出了 Video2GUI,这是一个完全自动化的框架,可以直接从未标记的互联网视频中提取界面定位的 GUI 交互轨迹。 Video2GUI 采用从粗到细的过滤策略来识别高质量的 GUI 教程视频并将其转换为结构化代理轨迹。将此管道应用于 5 亿个视频元数据条目,我们构建了 WildGUI,这是一个大型数据集,包含跨越 1,500 个应用程序和网站的 1200 万条交互轨迹。 预训练 WildGUI 上的 Qwen2.5-VL 和 Mimo-VL 在多个 GUI 基础和操作基准测试中实现了 5-20% 的持续改进,匹配或超越了最先进的性能。我们将发布 WildGUI 数据集和 Video2GUI 管道,以支持 GUI智能体 的未来研究。