想象行动:通过可扩展 GUI 的图像编辑世界模型进行高保真数据合成智能体训练
Imagine to Act: High-Fidelity Data Synthesis via Image Editing World Model for Scalable GUI Agent Training
摘要
图形用户界面 (GUI) 智能体已成为跨不同应用程序自动化复杂数字工作流程的有前途的范例。然而,训练高性能且可泛化的智能体从根本上依赖于大量的、高保真的视觉动作轨迹,而这些轨迹是出了名的难以获取。虽然人类演示是不可扩展的,但现有的 GUI 世界模型依赖于文本描述或 HTML 渲染,丢弃了关键的像素级视觉细节,例如图标和布局样式。为了解决这个问题,我们引入了 Infinite-Dreamer,这是一种由像素级图像编辑世界模型支持的免模拟数据合成方法。通过将 GUI 转换概念化为图像编辑任务,我们利用视觉语言模型 (VLM) 将操作引起的 UI 更改描述为结构化增量文本。然后我们将微调和骨干模型进行图像编辑,以可控地合成逼真的屏幕截图过渡。我们利用该模型生成单帧视觉鲁棒性数据和多步假想轨迹。为了验证我们方法的有效性,我们仅在合成数据上对 Qwen3-VL 基线进行微调以获得 Infinite-执行模型,并在 AndroidWorld、MobileWorld 和 AndroidControl-Culated 基准上对其进行评估。 Infinite-执行模型在各个尺度上始终优于 Qwen3-VL 基线:Infinite-执行模型-8B 将 AndroidWorld Pass@1 提高了 +4.45,并使 MobileWorld Pass@3 成功率几乎翻倍,而 Infinite-执行模型-2B 将 Pass@1 提高了 +9.05。代码可在 https://github.com/swaydy-n/Infinite-Dreamer. 获取
