论文

AutoGUIWorld:图像生成器作为 GUI Agent的视觉世界模型

AutoGUIWorld: Image Generators as Visual World Models for GUI Agent

模型训练合成数据

摘要

GUI Agent需要高质量的交互轨迹来了解软件环境如何响应操作、维护状态并支持多步骤工作流程。然而,可用轨迹的多样性受到底层环境中可访问的应用程序、界面状态和工作流程的限制。扩大覆盖范围需要部署日益多样化和复杂的软件,而专门的应用程序会带来额外的安装、配置和运行成本。我们引入了 AutoGUIWorld,一个数据生成框架,它将图像生成器的视觉先验与规划器的任务知识相结合,无需部署或运行相应的软件环境即可合成 GUI 交互轨迹。 AutoGUIWorld 从操作系统上下文、视觉外观和界面状态的结构化规范中对初始 GUI 场景进行采样,并生成以这些场景为条件的任务。然后,规划器指定原子操作及其预期的视觉结果,而图像生成器迭代地编辑当前屏幕截图以生成后续观察结果。动作定位和状态转移层面的质量过滤在 Ubuntu、Windows、macOS 和 Chrome 上生成了 79,266 个空间标注的步骤级训练样本。在 AutoGUIWorld 轨迹上微调 Qwen3.5-35B-A3B 将 OSWorld 上的平均任务得分从 33.0% 提高到 40.8%,将 ScienceBoard 上的任务成功率从 14.0% 提高到 32.2%。这些结果表明,生成的轨迹可以提高 GUI Agent在实际桌面和科学任务中的性能。

AutoGUIWorld:图像生成器作为 GUI Agent的视觉世界模型:图1:AutoGUIWorld概览。该方法先从操作系统底座、视觉外观空间和初始GUI状态空间采样结构化GUI世界,随后生成种子截图、按种子条件生成任务、规划原子动作,并以Image2作为视觉世界模型推出干净的GUI视觉状态序列。
图1:AutoGUIWorld概览。该方法先从操作系统底座、视觉外观空间和初始GUI状态空间采样结构化GUI世界,随后生成种子截图、按种子条件生成任务、规划原子动作,并以Image2作为视觉世界模型推出干净的GUI视觉状态序列。