论文
ClawGUI:用于训练、评估和部署 GUI智能体 的统一框架
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
摘要
GUI智能体 通过可视化界面而不是编程 API 来驱动应用程序,通过点击、滑动和击键与任意软件进行交互,从而达到基于 CLI 的代理无法达到的长尾应用程序。然而,这一领域进展的瓶颈与其说是建模能力,不如说是缺乏连贯的全栈基础设施:在线强化学习训练受到环境不稳定和封闭管道的影响,评估协议在工作中悄然漂移,训练有素的智能体很少接触到真实设备上的真实用户。我们提出了 \textbf{ClawGUI},这是一个开源框架,可以在单个工具中解决这三个差距。 \textbf{ClawGUI-RL} 提供第一个开源 GUI智能体 RL 基础设施,对并行虚拟环境和真实物理设备提供经过验证的支持,将 GiGPO 与过程奖励模型集成以实现密集的步骤级监督。 \textbf{ClawGUI-Eval} 在 6 个基准和 11 多个模型上强制执行完全标准化的评估流程,相对于官方基准实现了 95.8% 的再现。 \textbf{ClawGUI-Agent} 通过具有混合 CLI-GUI 控制和持久个性化内存的 12 多个聊天平台,为 Android、HarmonyOS 和 iOS 带来训练有素的代理。在此管道中进行端到端训练后,\textbf{ClawGUI-2B} 在仅 MobileWorld GUI 上实现了 17.1\% 的成功率,比相同规模的 MAI-UI-2B 基线高出 6.0\%。