Qwen-UI-Agent技术报告:迈向下一代以真实场景为中心的基础GUI智能体
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
摘要
GUI 智能体有潜力成为现有数字设备之上的通用执行器。为推动其走向真实应用,我们设想的智能体应能在真实设备上可靠运行、跨平台执行工作流、将 GUI 交互与 CLI 执行相结合、完成长程任务、主动发起有用的服务,并以最少人工投入自主提升能力。在这一愿景指引下,我们提出 Qwen-UI-Agent,一个覆盖移动、计算机使用、网页与 DeepSearch 环境、以真实场景为中心的基础 GUI 智能体。Qwen-UI-Agent 将多样化沙盒环境与大规模真机移动运行时相结合。其统一动作空间将 GUI 操作与 CLI 执行交织在一起,并在单次模型轮次中生成批量动作。一套 AutoResearch 式数据飞轮利用智能体构建任务与环境、诊断失败并规划后续迭代。在线强化学习支持在超过 100 轮的轨迹上训练,并以超过 10,000 个并发环境加速 rollout。轻量级 harness 层支持跨移动与计算机的主动服务发起和有状态工作流。在广泛的评测套件中,Qwen-UI-Agent 在移动使用基准上创造了最先进成绩,同时在计算机与浏览器使用任务上相较前沿模型(包括 Opus 4.8、Gemini 3.1 Pro 和 GPT-5.6 Sol)表现具有竞争力。在移动使用上,它在 MobileWorld 上取得 82.1%、在 MobileWorld-Real 上取得 92.2%、在 AndroidDaily 上取得 97.5%。在计算机使用上,它在 OSWorld-Verified 上取得 79.5%,在 OSWorld-v2 上取得 40.0% 的部分进度分。在浏览器使用与 GUI 定位上,它分别在 WebArena 上取得 73.6%、在 ScreenSpot-Pro 上取得 81.5%。
