论文

SCAFFOLD:通过递归参数化技能抽象改进Web Agent

SCAFFOLD: Self-Improving Web Agents via Recursive Parametric Skill Abstraction

智能体系统Agent HarnessAgent Skills

摘要

Web 智能体需要导航视觉丰富、跨站点变化的长视野界面,但大多数以前的智能体仍然孤立地学习每个任务,并丢弃他们积累的程序知识。最近的技能增强框架迈出了重要的第一步,但它们将技能库视为平面或两层提示端缓存,并且没有提供用于压缩冗余或递归组合技能的原则性机制。我们引入了 \textsc{Scaffold},这是一个用于视觉网络智能体的自我改进框架,它(i)在多实例抽象约束下从成功的轨迹中引入参数化的可执行技能,(ii)维护一个递归组合的层次结构,其中较高级别的技能调用较低级别的技能,(iii)通过最小描述长度(MDL)标准和行为等效性检查来压缩库,以及(iv)定期提取技能增强的技能将轨迹返回到模型权重中以内化抽象。在 WebArena、VisualWebArena 和 Online-Mind2Web 的保留分支中,\textsc{Scaffold} 将成功率比最强的技能增强基线提高了 $11.1$-$17.2$ 绝对点,并且在五次自我改进迭代中显示出单调增益,而没有库崩溃。我们在Github \href{此https URL }{repository}中发布了代码和文档。

SCAFFOLD:通过递归参数化技能抽象改进Web Agent:论文配图
图 1:Scaffold 框架概述。这五个阶段在每次迭代中按顺序执行:推出、多实例归纳、递归组合、MDL 驱动的压缩和蒸馏。深度和宽度不断增长的库会定期被压缩。