论文

M²-Miner:用于移动GUI智能体数据挖掘的多智能体增强MCTS

M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining

模型训练合成数据

摘要

图形用户界面(GUI)智能体是推进智能人机交互范式的关键。构建强大的GUI智能体需要对高质量用户行为轨迹数据(即意图-轨迹对)进行大规模标注以供训练。然而,人工标注方法和现有GUI智能体数据挖掘方法通常面临三个关键挑战:构建成本高、数据质量差、数据丰富度低。为解决这些问题,我们提出M²-Miner,首个基于蒙特卡洛树搜索(MCTS)的低成本自动化移动GUI智能体数据挖掘框架。为提升数据挖掘的效率与质量,我们提出一个协作式多智能体框架,由负责引导的InferAgent、负责加速的OrchestraAgent和负责评估的JudgeAgent组成。为进一步提高挖掘效率并丰富意图多样性,我们设计了意图回收策略来抽取额外有价值的交互轨迹。此外,还引入渐进式模型在环训练策略以提高数据挖掘成功率。大量实验表明,用我们挖掘的数据微调的GUI智能体在多个常用移动GUI基准上取得最先进性能。我们的工作将被发布,以促进社区研究。

M²-Miner:用于移动GUI智能体数据挖掘的多智能体增强MCTS
图1:左:不同的GUI数据结构。(a) 扁平的人工标注GUI数据,仅存储与每个意图对应的单条轨迹。(b) 原始树状结构GUI agent数据,其中每棵树与单个意图相关联。(c) 我们的多意图树结构,其中每棵树包含多个意图及其对应的轨迹。右:意图分布的t-SNE可视化。与现有方法相比,我们的意图回收策略从相同的初始意图产生更加多样化的意图集合。