论文

UI-KOBE:面向知识的行为探索,用于轻量级图引导GUI智能体

UI-KOBE: Knowledge-Oriented Behavior Exploration for Lightweight Graph-Guided GUI Agents

智能体系统Agent 规划

摘要

移动GUI智能体的最新进展显示出自动化移动任务的强大潜力,但大多数有效系统仍依赖大型视觉语言模型进行截图理解与长程规划。可直接部署在移动设备上的小型GUI智能体在实际使用中更具吸引力,其推理成本更低,并能更好地保护设备上的敏感信息。然而,由于模型容量有限,此类轻量级智能体仅凭截图端到端地规划并执行GUI任务时仍不可靠。我们提出面向知识的行为探索(UI-KOBE),一个利用可复用的应用专属图知识来改进轻量级移动GUI智能体的框架。UI-KOBE首先自主探索移动应用并构建应用知识图谱,其中节点表示不同的UI状态,边表示可执行的转移。在运行时,轻量级GUI智能体将该图作为外部引导:给定用户任务和当前截图,它识别当前图节点,并在该节点关联的自环动作、相邻转移、任务完成或回退自由动作中进行选择。通过以应用专属图引导支持运行时决策,UI-KOBE减轻了端到端GUI规划的负担,帮助轻量模型更有效地完成移动GUI任务,为高效、可解释且注重隐私的端侧GUI智能体迈出了务实一步。

UI-KOBE:面向知识的行为探索,用于轻量级图引导GUI智能体:论文配图
图 1:我们的框架概述。 UI-KOBE 首先探索目标应用程序并构建应用程序知识图,其中节点代表 UI 状态,边代表可执行转换。在运行时,轻量级 GUI 代理使用图形来识别当前节点,检索本地转换知识,选择下一个操作,并逐步执行任务。