论文
Xiaomi-GUI-0技术报告
Xiaomi-GUI-0 Technical Report
摘要
图形用户界面(GUI)智能体基于视觉语言模型通过点击、滑动、文本输入与导航等界面动作在真实应用中端到端完成用户任务。但既有GUI智能体主要在离线轨迹、仿真环境与标准化基准上训练评估——在界面布局、交互逻辑与异常状态分布上与真实应用差异显著,无法忠实表征真实使用中的执行稳定性——账号状态、权限弹窗、支付验证与风控持续重塑状态分布,导致基准分数与真实可用性之间的持续差距。为此我们提出Xiaomi-GUI-0:面向真实移动环境的原生多模态GUI智能体——在真机闭环中训练与评估。核心是真机主导的混合基础设施:物理设备为主要执行环境、沙箱提供辅助支持——使数据收集、训练、rollout与评估共享接近真实部署的执行分布。我们构建跨多来源的训练数据——覆盖高频头部任务、长尾意图的高泛化数据与反思记忆的能力增强数据——并引入错误驱动的数据飞轮:将失败轨迹转为纠正动作、反思解释与恢复示范。模型经监督微调、步级强化学习与智能体强化学习的渐进三阶段管线训练。在公开基准与自建RealMobile上评估:Xiaomi-GUI-0在RealMobile取得72.0%成功率、AndroidWorld取得78.9%,同时大幅改善真实任务中的执行稳定性与异常状态识别。
