论文

OmegaUse:构建用于自主任务执行的通用GUI智能体

OmegaUse: Building a General-Purpose GUI Agent for Autonomous Task Execution

模型训练强化学习合成数据RLVRAgentic RL

摘要

图形用户界面(GUI)智能体展现出使基础模型完成真实任务的巨大潜力,革新人机交互并提升人类生产力。在本报告中,我们提出OmegaUse,一个在移动和桌面平台上自主执行任务的通用GUI智能体模型,支持计算机使用和手机使用场景。构建有效的GUI智能体模型依赖两个因素:(1)高质量数据;(2)有效的训练方法。为此,我们引入精心设计的数据构建流水线和解耦的训练范式。在数据构建方面,我们利用严格整理的开源数据集,并引入一种新型自动合成框架,将自下而上的自主探索与自上而下的分类学引导生成相结合,创建高保真合成数据。在训练方面,为更好利用这些数据,我们采用两阶段策略:监督微调(SFT)建立基础交互语法,随后组相对策略优化(GRPO)提升空间接地和序列规划。为平衡计算效率与Agentic推理能力,OmegaUse构建于混合专家(MoE)骨干之上。为在离线设置下评估跨终端能力,我们引入OS-Nav基准套件,涵盖多个操作系统:面向中国Android移动环境的ChiM-Nav,以及聚焦Ubuntu常规桌面交互的Ubu-Nav。大量实验表明,OmegaUse在既有GUI基准上极具竞争力,在ScreenSpot-V2上取得96.3%的最先进分数,在AndroidControl上取得79.1%的领先步成功率。OmegaUse在OS-Nav上同样表现强劲,ChiM-Nav步成功率74.24%,Ubu-Nav平均成功率55.9%。

OmegaUse:构建用于自主任务执行的通用GUI智能体
图2:OmegaUse 框架的总体架构。流水线经过四个不同的层次:(1) 混合数据处理阶段,结合自动化 LLM 辅助标注与人在环(human-in-the-loop)精修;(2) 对 MoE 基础模型进行 SFT;(3) 使用 GRPO 的解耦 RL,针对 grounding 与导航任务采用定制奖励;(4) 将优化后的智能体最终部署到多样的应用环境中。