论文

带挑战地学习:面向移动GUI智能体训练的自适应难度感知数据生成

Learning with Challenges: Adaptive Difficulty-Aware Data Generation for Mobile GUI Agent Training

模型训练合成数据

摘要

大规模、高质量的交互轨迹对推进移动图形用户界面(GUI)智能体至关重要。现有方法通常依赖劳动密集型的人类演示或自动化模型探索来生成GUI轨迹,但缺乏对任务难度的细粒度控制。由于训练难度与智能体能力不匹配,这从根本上限制了学习效果。受人类通过渐进挑战性任务习得技能的启发,我们提出MobileGen,一个把训练难度自适应对齐到GUI智能体能力边界的新型数据生成框架。具体而言,MobileGen显式把任务难度解耦为结构维度(如轨迹长度)与语义维度(如任务目标)。它随后在一个精选的先验数据集上迭代评估智能体,构建其在两个维度上能力边界的系统画像。基于该画像,自适应计算任务难度的概率分布,从中采样下一轮训练的目标难度。在采样难度引导下,最终用多智能体可控生成器合成高质量交互轨迹及相应任务指令。大量实验表明,MobileGen在多个挑战性基准上将GUI智能体的平均性能提升1.57倍,持续超越现有数据生成方法。这凸显了能力对齐数据生成对有效移动GUI智能体训练的重要性。

带挑战地学习:面向移动GUI智能体训练的自适应难度感知数据生成
图1:MobileGen 概览。我们的流水线包含三个关键阶段:(1) Agent Capability Profiling:在先前数据集上评估学生智能体 ℳ_student,得到结构与语义能力画像。(2) Difficulty Distribution Generation:基于这些画像设置挑战点,以形成目标难度分布。(3) Difficulty-Aware Trajectory Generation:在采样到的难度参数引导下,两个智能体 ℳ_explorer 与 ℳ_supervisor 协作生成交互轨迹。随后,推理痕迹与指令将通过逆向合成(inverse synthesis)进行重构。