论文

Jev-Mobile:以Jev作为移动GUI Agent的执行器

Jev-Mobile: Jev as an Executor for Mobile GUI Agents

智能体系统模型推理判别式推理与决策Agent 架构与控制循环Jev

摘要

视觉语言模型(VLM)已成为自主移动GUI Agent的常见基础,但大多数现有系统在几乎每个交互步骤都依赖VLM同时完成规划与动作目标定位,带来显著的延迟和模型服务成本。我们提出Jev-Mobile,将该范式转变为低频VLM规划与高频轻量执行:VLM指定局部目标,无障碍树定义结构化的可执行动作空间,而Jev——一个快速的类型化决策模型——在该空间内反复选择动作。这一设计使得单次VLM决策下可以执行多个GUI动作,在保持自适应交互的同时减少昂贵的VLM推理。在完整的AndroidWorld任务套件上,Jev-Mobile取得79%的任务成功率,而SeeAct-V为78%,逐步VLM基线为84%。在成功轨迹中,相对于逐步VLM,它将平均端到端执行时间降低32.7%,平均模型API成本降低73.4%。这些结果表明,将高层VLM推理与低层动作执行解耦,可以在保持有竞争力的任务性能的同时,大幅提升移动GUI Agent的效率。