论文
SCAFFOLD:通过递归参数化技能抽象改进Web Agent
SCAFFOLD: Self-Improving Web Agents via Recursive Parametric Skill Abstraction
摘要
Web 智能体需要导航视觉丰富、跨站点变化的长视野界面,但大多数以前的智能体仍然孤立地学习每个任务,并丢弃他们积累的程序知识。最近的技能增强框架迈出了重要的第一步,但它们将技能库视为平面或两层提示端缓存,并且没有提供用于压缩冗余或递归组合技能的原则性机制。我们引入了 \textsc{Scaffold},这是一个用于视觉网络智能体的自我改进框架,它(i)在多实例抽象约束下从成功的轨迹中引入参数化的可执行技能,(ii)维护一个递归组合的层次结构,其中较高级别的技能调用较低级别的技能,(iii)通过最小描述长度(MDL)标准和行为等效性检查来压缩库,以及(iv)定期提取技能增强的技能将轨迹返回到模型权重中以内化抽象。在 WebArena、VisualWebArena 和 Online-Mind2Web 的保留分支中,\textsc{Scaffold} 将成功率比最强的技能增强基线提高了 $11.1$-$17.2$ 绝对点,并且在五次自我改进迭代中显示出单调增益,而没有库崩溃。我们在Github \href{此https URL }{repository}中发布了代码和文档。
