论文

DRIVE:持续学习下面向Web智能体的推理与交互双层技能建模

DRIVE: Modeling Skills at the Reasoning and Interaction Levels for Web Agents under Continual Learning

智能体系统上下文与知识记忆Agent SkillsAgent记忆

摘要

Web智能体需要高层推理(用于任务分解)与低层交互(用于页面元素操作)来完成不同任务。然而,这两类知识有本质差异:推理知识(如订机票需先搜索航线)是抽象的、可跨网站迁移的,而交互知识(如点击站点A特定坐标上的Search按钮)高度依赖页面特定上下文。现有方法统一存储经验。这造成一个两难:抽象表示在具体页面上失去可执行性,而具体表示无法跨领域泛化。这种纠缠限制了能力积累:在新网站上,智能体要么因表面差异而无法识别可复用的任务逻辑,要么依据过时的页面结构尝试不可行动作。为解耦二者,我们提出DRIVE,一个双层技能建模框架,将历史经验分离为捕捉可迁移任务逻辑的自然语言推理技能,以及将抽象动作落地为可执行操作的程序化交互技能。场景感知的协调机制根据任务语义自适应地检索并调用这些双层技能。DRIVE还利用技能级反思识别各层级特有的失败模式,实现有针对性的技能库扩展与精炼。在五个WebArena域上的实验显示,DRIVE取得52.8%的平均任务成功率,超过无技能基线7.3个百分点。进一步消融显示,推理技能与交互技能提供了不同且互补的收益,支持将可迁移任务逻辑与可执行页面级操作分离。

DRIVE:持续学习下面向Web智能体的推理与交互双层技能建模:论文配图
图 1:DRIVE 概述。 DRIVE 由用于技能抽象和演化的离线阶段和用于场景感知技能重用的在线阶段组成。线下阶段将历史网络交互轨迹抽象为推理和交互技能,这些技能被组织在分层技能库中,并通过进化进行细化。在线执行过程中,Agent根据任务语义和页面观察检索相关技能,并将执行反馈反馈给离线阶段,形成闭环细化流​​程。