论文

ActionEngine:借助状态机记忆从反应式走向程序化的 GUI 智能体

ActionEngine: From Reactive to Programmatic GUI Agents via State Machine Memory

上下文与知识智能体系统记忆Agent HarnessAgent记忆

摘要

现有图形用户界面(GUI)智能体通过逐步调用视觉语言模型运作——截图、推理下一步动作、执行,然后在新页面上重复——导致成本与延迟随推理步数增长,且因没有对已访问页面的持久记忆而准确率受限。我们提出 ActionEngine,一个免训练框架,通过新颖的双智能体架构从反应式执行转向程序化规划:Crawling Agent 通过离线探索构建可更新的 GUI 状态机记忆,Execution Agent 利用该记忆合成完整可执行的 Python 程序以在线执行任务。为确保对界面演化的鲁棒性,执行失败会触发基于视觉的重新定位回退,修复失败动作并更新记忆。该设计大幅改善效率与准确率:在 WebArena 基准的 Reddit 任务上,我们的智能体平均仅需一次 LLM 调用即达到 95% 的任务成功率,而最强的纯视觉基线为 66%,同时成本降低 11.8 倍,端到端延迟降低 2 倍。这些组件共同通过全局程序化规划、经爬虫验证的动作模板以及带局部验证与修复的节点级执行,实现了可扩展且可靠的 GUI 交互。

ActionEngine:借助状态机记忆从反应式走向程序化的 GUI 智能体
图2:包含两个专用智能体的系统架构。爬取智能体(Crawling Agent,上方,离线)探索网站/应用,以构建并维护状态机记忆。执行智能体(Execution Agent,下方,在线)利用该记忆生成高层程序草稿,通过图搜索将其落地为可执行的 UI 调用,并编译和执行该计划。当执行失败时,基于 MLLM 的回退机制进行恢复并更新记忆,同时由 Python 校验器处理逻辑错误。