论文

GUICrafter:利用海量未标注截图的弱监督GUI智能体

GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots

模型训练预训练强化学习Agentic RL

摘要

数据作为现代智能的基础基底,极大地推动了当前基础模型的发展。自然,研究者希望把该范式扩展到GUI智能体领域。但GUI智能体数据无法直接从互联网获取——大规模收集成本高且困难。因此当前GUI智能体苦于跨设备泛化差与对细粒度GUI元素的视觉落地能力有限。作为解决GUI智能体数据挑战的尝试,我们提出GUICrafter:利用海量未标注截图的弱监督GUI智能体——大幅降低对昂贵人工标注的依赖。GUICrafter探索课程学习框架经两个渐进阶段训练GUI智能体:第一阶段模型从大规模未标注截图与网页学习视觉落地,利用GUI交互中固有的丰富上下文信号而无需人工标注;第二阶段用少量高质量数据经强化学习校准模型。实验显示GUICrafter取得与UI-TARS等先进系统有竞争力甚至超越的表现——而仅用其0.1%的数据。在相同标注数据量下,GUICrafter超过GUI-R1等所有既往方法。代码、数据与模型见https://github.com/fansunqi/GUICrafter。

GUICrafter:利用海量未标注截图的弱监督GUI智能体:论文配图
图 1:左图:第一阶段弱监督 GUI 预训练的流程,包括数据准备和训练过程。右图:我们的 GUICrafter 模型在 Mind2Web [8] 和 ScreenSpot-Pro [16] 基准测试中实现了比所有基线更高的平均锚定精度。 GUI-R1 的结果是使用相同数量的带注释的训练数据再现的。我们还强调了第一阶段和第二阶段分别带来的重大改进。