UI-Mate:用上下文示范推进开放权重基础GUI Agent
UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations
摘要
基础GUI Agent可以自动化复杂的数字任务,但部署受到训练数据稀缺且有偏、提示含糊、执行不可靠的阻碍。常规工作流依赖用户特定的工具与默契约定,因此未言明的指令可能在多次运行中产生任意的变体。我们提出UI-Mate,一个将基于真实环境反馈的训练栈与上下文示范学习相结合的基础GUI Agent。UI-Mate有三项贡献:可扩展的基于真实环境反馈训练栈——一个闭环数据引擎,通过统一的任务-验证器包,在大规模并行环境中自动化任务生成、环境构建、轨迹滚动、过滤、能力平衡、SFT与在线RL。上下文示范学习——一种把多模态示范转化为灵活的子任务级工作流的机制,遵循相关的示范步骤,并根据实时界面重新规划。OSWorkerBench基准与洞见——一个覆盖41个应用、100个长程办公任务的基准,支持仅指令与示范引导两种评估。其示范资源区分了33个任务的自示范设置(由同一目标的成功强Agent轨迹构建)与45个任务的变体示范设置(由相关但不完全相同任务的人工录制构建)。实验表明,UI-Mate-27B在通用计算机使用基准上创造了新的开放权重最优成绩,在OSWorld-Verified上得分77.0%,在WindowsAgentArena上得分66.2%。在OSWorkerBench上,它达到41.0%的严格成功率与76.9%的进度,分别超过其Qwen3.6-27B基座17.7与24.5分。在33个任务的自示范子集上,一条示范把严格成功率从17.2%提高到35.4%,进度从67.9%提高到81.1%,显著改善了长程可靠性。项目页面:https://ui-mate.github.io。
