论文
Weasel:通过重要性多样性数据选择对 Web 代理进行域外泛化
Weasel: Out-of-Domain Generalization for Web Agents via Importance-Diversity Data Selection
摘要
大语言模型 (LLM) 启用了通过多步浏览器交互遵循自然语言目标的 Web 代理。然而,在特定轨迹和域上进行微调的代理通常很难泛化到域外,并且由于噪声、冗余轨迹和长可访问树(AXTree)状态,离线训练可能会导致计算效率低下。为了解决这两个问题,我们提出了 Weasel,一种用于网络代理离线训练的轨迹选择方法。 Weasel 通过优化目标来选择轨迹步骤的固定预算子集,该目标平衡状态、网站和交互模式上的一元重要性与成对多样性,并使用贪婪算法高效求解。我们通过以目标为中心的 AXTree 修剪进一步提高效率,该修剪仅保留 真值 操作目标周围的内容,并且我们通过用模型生成的、风格一致的基本原理替换专家跟踪来减轻推理本机模型的风格不匹配。在 AgentTrek 和 NNetNav 训练数据集、WebArena、WorkArena 和 MiniWob 中的评估以及 Qwen2.5-7B、Gemma3-4B 和 Qwen3-8B 的实验中,Weasel 提高了域外性能,同时降低了训练成本,与标准 微调 相比,训练速度提高了大约 9.7-12.5 倍。我们在 https://github.com/fatemehpesaran310/weasel 提供代码。