论文
移动GUI导航视觉语言智能体的扩展、基准评测与推理
Scaling, Benchmarking, and Reasoning of Vision-Language Agents for Mobile GUI Navigation
摘要
视觉语言模型(Vision-Language Models, VLMs)在移动GUI导航方面进展迅速。本文对该领域中基于VLM的智能体的数据扩展、基准评测与推理进行了系统研究。为支持严格评测,我们提出HyperTrack,一个涵盖650多个中国移动应用、超过16000个真实任务的大规模数据集;同时推出GUIEvalKit,一个用于对VLM在离线GUI导航任务上进行统一评测的开源工具包。利用HyperTrack,我们分析了训练数据规模对监督微调与基于强化学习的微调的影响。结果表明,基于强化学习的微调持续优于监督微调,尤其在域外设置中,凸显了数据扩展与强化学习之间的协同效应。借助GUIEvalKit,我们进一步对最先进(SOTA)的VLM进行基准评测,并分析交互历史与推理能力如何影响任务完成。HyperTrack与GUIEvalKit共同为开发和评测移动GUI导航任务中的VLM智能体提供了全面平台。
