论文
GUICrafter:利用海量未标注截图的弱监督GUI智能体
GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots
摘要
数据作为现代智能的基础基底,极大地推动了当前基础模型的发展。自然,研究者希望把该范式扩展到GUI智能体领域。但GUI智能体数据无法直接从互联网获取——大规模收集成本高且困难。因此当前GUI智能体苦于跨设备泛化差与对细粒度GUI元素的视觉落地能力有限。作为解决GUI智能体数据挑战的尝试,我们提出GUICrafter:利用海量未标注截图的弱监督GUI智能体——大幅降低对昂贵人工标注的依赖。GUICrafter探索课程学习框架经两个渐进阶段训练GUI智能体:第一阶段模型从大规模未标注截图与网页学习视觉落地,利用GUI交互中固有的丰富上下文信号而无需人工标注;第二阶段用少量高质量数据经强化学习校准模型。实验显示GUICrafter取得与UI-TARS等先进系统有竞争力甚至超越的表现——而仅用其0.1%的数据。在相同标注数据量下,GUICrafter超过GUI-R1等所有既往方法。代码、数据与模型见https://github.com/fansunqi/GUICrafter。
