论文

AutoSurfer:通过全面冲浪、学习与建模教导网页智能体

AutoSurfer -- Teaching Web Agents through Comprehensive Surfing, Learning, and Modeling

模型训练合成数据

摘要

多模态大语言模型(LLM)的最新进展彻底改变了能够在网站上自动化复杂任务的网页智能体。然而,其准确率仍受限于高质量网页轨迹训练数据的稀缺。现有自动轨迹生成方法因基于首页的任务提出或随机游走探索而存在网站覆盖不全的问题。这类方法常导致幻觉或含糊的任务合成,造成不完整、不可靠的轨迹生成。本文提出AutoSurfer,一个通过三项关键创新解决上述局限的综合性网页轨迹生成器。第一,AutoSurfer采用系统化的广度优先探索策略:维护已发现页面与动作轨迹的队列,跨页面传播知识以避免冗余探索,并递归展开多层图形用户界面元素——与人类学习一个新网站的方式十分接近。第二,AutoSurfer利用探索轨迹引导任务合成,通过将复杂任务锚定在真实导航路径而非孤立动作或页面内容上,减少幻觉。第三,AutoSurfer将同一探索轨迹用作提示,引导网页智能体进行更准确、更可靠的轨迹精炼。这些创新共同使AutoSurfer能够全面覆盖一个网站的动作空间,并生成适合训练网站专用LLM的数据。我们通过微调Qwen2.5-VL-7B-Instruct在WebArena基准上评估AutoSurfer,结果表明它优于最先进方法Explorer、OS-Genesis与SynthAgent,整体任务完成准确率最高达24.23%,而此前最佳方法为19.59%。此外,任务多样性分析表明AutoSurfer合成的任务分布更加多样。

AutoSurfer:通过全面冲浪、学习与建模教导网页智能体:论文配图
图 1:AutoSurfer 的完整架构。给定一个 Web 环境,(a) AutoSurfer 全面探索网站以发现复杂的任务及其轨迹,(b) AutoSurfer 细化所发现的任务和轨迹,以提高正确性和质量,同时减少幻觉,(c) AutoSurfer 将细化的任务和轨迹转换为 SFT 数据集,(d) AutoSurfer 使用 SFT 数据集来训练 wLLM。