论文
AutoGUIWorld:图像生成器作为 GUI Agent的视觉世界模型
AutoGUIWorld: Image Generators as Visual World Models for GUI Agent
摘要
GUI Agent需要高质量的交互轨迹来了解软件环境如何响应操作、维护状态并支持多步骤工作流程。然而,可用轨迹的多样性受到底层环境中可访问的应用程序、界面状态和工作流程的限制。扩大覆盖范围需要部署日益多样化和复杂的软件,而专门的应用程序会带来额外的安装、配置和运行成本。我们引入了 AutoGUIWorld,一个数据生成框架,它将图像生成器的视觉先验与规划器的任务知识相结合,无需部署或运行相应的软件环境即可合成 GUI 交互轨迹。 AutoGUIWorld 从操作系统上下文、视觉外观和界面状态的结构化规范中对初始 GUI 场景进行采样,并生成以这些场景为条件的任务。然后,规划器指定原子操作及其预期的视觉结果,而图像生成器迭代地编辑当前屏幕截图以生成后续观察结果。动作定位和状态转移层面的质量过滤在 Ubuntu、Windows、macOS 和 Chrome 上生成了 79,266 个空间标注的步骤级训练样本。在 AutoGUIWorld 轨迹上微调 Qwen3.5-35B-A3B 将 OSWorld 上的平均任务得分从 33.0% 提高到 40.8%,将 ScienceBoard 上的任务成功率从 14.0% 提高到 32.2%。这些结果表明,生成的轨迹可以提高 GUI Agent在实际桌面和科学任务中的性能。
