论文
ActionEngine:借助状态机记忆从反应式走向程序化的 GUI 智能体
ActionEngine: From Reactive to Programmatic GUI Agents via State Machine Memory
摘要
现有图形用户界面(GUI)智能体通过逐步调用视觉语言模型运作——截图、推理下一步动作、执行,然后在新页面上重复——导致成本与延迟随推理步数增长,且因没有对已访问页面的持久记忆而准确率受限。我们提出 ActionEngine,一个免训练框架,通过新颖的双智能体架构从反应式执行转向程序化规划:Crawling Agent 通过离线探索构建可更新的 GUI 状态机记忆,Execution Agent 利用该记忆合成完整可执行的 Python 程序以在线执行任务。为确保对界面演化的鲁棒性,执行失败会触发基于视觉的重新定位回退,修复失败动作并更新记忆。该设计大幅改善效率与准确率:在 WebArena 基准的 Reddit 任务上,我们的智能体平均仅需一次 LLM 调用即达到 95% 的任务成功率,而最强的纯视觉基线为 66%,同时成本降低 11.8 倍,端到端延迟降低 2 倍。这些组件共同通过全局程序化规划、经爬虫验证的动作模板以及带局部验证与修复的节点级执行,实现了可扩展且可靠的 GUI 交互。
