论文
MobileDreamer:面向GUI Agent的生成式草图世界模型
MobileDreamer: Generative Sketch World Model for GUI Agent
摘要
移动GUI Agent在真实世界自动化和实际应用中展现出强大潜力。然而,现有大多数Agent仍是反应式的,主要根据当前屏幕做决策,这限制了它们在长程任务上的表现。通过反复交互构建世界模型可以预测动作结果,为移动GUI Agent提供更好的决策支持。这具有挑战性,因为模型必须在具备空间感知的情况下预测动作后状态,同时保持足够高效以便实际部署。本文提出MobileDreamer,一个高效的世界模型前瞻框架,利用世界模型提供的未来想象来装备GUI Agent。它由文本草图世界模型和面向GUI Agent的rollout想象构成。文本草图世界模型通过一个将数字图像转化为关键任务相关草图的学习过程来预测动作后状态,并设计了一种新颖的顺序不变学习策略以保留GUI元素的空间信息。面向GUI Agent的rollout想象策略利用世界模型的预测能力优化动作选择过程。在Android World上的实验表明,MobileDreamer取得最先进性能,将任务成功率提升5.25%。世界模型评估进一步验证我们的文本草图建模能准确预测关键GUI元素。
