论文

AutoRPA:通过 LLM 驱动的交互式代码合成实现高效 GUI 自动化

AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions

智能体系统Agent 环境交互

摘要

基于大语言模型(LLM)的智能体已展现出与图形用户界面(GUI)进行多步交互的娴熟能力。尽管多数研究聚焦于提升单任务性能,实际场景常涉及重复性 GUI 任务,对其反复调用 LLM 推理(即 ReAct 范式)效率低下。在 LLM 出现之前,传统的机器人流程自动化(RPA)具备运行时效率,但开发与维护需要大量人工投入。为弥合这一鸿沟,我们提出 AutoRPA,一个将 ReAct 风格智能体的决策逻辑自动提炼为健壮 RPA 函数的框架。AutoRPA 引入两项核心创新:(1)翻译-构建流水线,翻译智能体将硬编码的 ReAct 动作转换为软编码过程,构建智能体通过对多条轨迹的检索增强生成来合成健壮的 RPA 函数;(2)代码验证阶段的混合修复策略,将 RPA 执行与基于 ReAct 的回退相结合进行迭代改进。在多个 GUI 环境中的实验表明,AutoRPA 生成的 RPA 函数能成功解决类似任务,同时将 token 使用量降低 82% 至 96%,显著提升运行效率与可复用性。

AutoRPA:通过 LLM 驱动的交互式代码合成实现高效 GUI 自动化:论文配图
图 1:GUI 自动化范例的比较。 (a) ReAct 风格的 LLM 代理实现了很高的灵活性,但会产生大量的每个实例成本,不适合重复性任务。 (b) 传统 RPA 可以提高重复性任务的效率,但需要手动编写脚本。 (c) AutoRPA 从 LLM 代理交互中自动合成针对任意任务类型的强大、低成本的 RPA 功能。