论文

OpenMobile:通过任务与轨迹合成构建开放移动智能体

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

模型训练上下文与知识合成数据记忆Agent记忆

摘要

由视觉语言模型驱动的移动智能体在自动化移动任务上展现出令人印象深刻的能力,近期的领先模型实现了显著的性能跃升,例如在AndroidWorld上接近70%的成功率。然而,这些系统对其训练数据保密,对其任务与轨迹合成配方也讳莫如深。我们提出OpenMobile,一个合成高质量任务指令与智能体轨迹的开源框架,包含两个关键组件:(1) 可扩展的任务合成流水线,先从探索中构建全局环境记忆,再利用它生成多样且符合实际环境的指令;(2) 用于轨迹rollout的策略切换策略。通过在学习者模型与专家模型之间交替,它捕获了标准模仿学习中常常缺失的关键错误恢复数据。在我们的数据上训练的智能体在三个动态移动智能体基准上取得有竞争力的结果:值得注意的是,微调后的Qwen2.5-VL与Qwen3-VL在AndroidWorld上分别达到51.7%与64.7%,远超现有开放数据方法。此外,我们对合成指令与基准测试集之间的重叠进行了透明分析,验证性能提升源于广泛的功能覆盖而非基准过拟合。我们在 https://njucckevin.github.io/openmobile/ 发布数据与代码,以弥合数据鸿沟并促进更广泛的移动智能体研究。

OpenMobile:通过任务与轨迹合成构建开放移动智能体:论文配图
图 1:性能比较。三个动态移动代理基准的任务成功率。我们的模型显着超越开放数据基线,并且与领先的封闭数据系统具有竞争力。数据缩放。 AndroidWorld 性能随着合成指令的增加而增加。纠错能力。 OpenMobile 数据极大地增强了代理在实时环境中的错误恢复能力。