论文

移动世界模型如何引导GUI智能体?

How Mobile World Model Guides GUI Agents?

智能体系统Agent 环境交互

摘要

视觉语言模型的最新进展使移动GUI智能体能够感知视觉界面并执行用户指令,但对动作后果的可靠预测对长程与高风险交互仍然至关重要。现有移动世界模型只提供基于文本或基于图像的未来状态,但哪种表征有用、生成的rollout能否替代真实环境、以及测试时指导对不同强度的智能体有何帮助,仍不清楚。为回答上述问题,我们过滤并标注移动世界模型数据,然后训练四种模态的世界模型:增量文本、全量文本、基于扩散的图像和可渲染代码。这些模型在MobileWorldBench和Code2WorldBench上均取得SoTA性能。此外,通过在AITZ、AndroidControl和AndroidWorld上评估其下游效用,我们得到三点发现。第一,可渲染代码重建在分布内具有高保真度,并为数据构建提供有效的多模态监督,而基于文本的反馈对在线分布外(OOD)执行更为鲁棒。第二,世界模型生成的轨迹能在训练过程中提供可迁移的交互经验并提升智能体的端到端任务表现,尽管这些数据并不保持原始分布。最后,对于动作熵低、过度自信的移动智能体,后验自我反思收益有限,表明世界模型更适合作先验感知或训练监督,而非通用的后验验证器。

移动世界模型如何引导GUI智能体?:论文配图
图 1:预测格式、测试时指导和基于想象力的训练的实证结果概述。 (a) 法官 VLM 和 MobileWorldModel (MWM) 的世界模型预测质量。 (b) 离线 GUI 导航:基本代理与世界模型交互变体(包括 PASS@3)的总体步骤准确性。 (c) M3A 下带有文本与图像反馈的在线 AndroidWorld 总体成功率 (SR)。 (d) 世界模型想象轨迹 (WM-SFT) 与 AndroidControl 步骤精度和 AndroidWorld SR 上的基本检查点的微调。