论文
通过过滤改进基于 LLM 的自治 Web 代理
Improving LLM-based Autonomous Web Agents with Filtering
摘要
由大型语言模型 (LLM) 提供支持的自主网络代理因具有多步推理和决策功能而自动执行各种基于网络的任务而受到广泛关注。这些代理开发中的一个开放研究问题在于网页输入的格式。原始 HTML 源代码具有大量且通常不相关的细节,给上下文窗口有限的大语言模型带来了困难。为了应对这一挑战,我们首先在 WebArena(Zhou 等人,2023)基准测试上重现 GPT-3.5 和 LLaMA-2-70B 等基线模型,识别常见的故障模式。然后,我们提出两种检索策略来过滤掉 LLM 代理的不相关上下文。我们开发基于 DeBERTa 和 T5 的模型,根据 HTML 元素与任务的相关性对它们进行排名。我们在 Mind2Web 轨迹数据上对它们进行微调,并将它们传输到 WebArena。实验表明,我们基于 DeBERTa 的模型将 LLaMA-2-70B LLM 代理在 WebArena 上的成功率从 1.97% 提高到 2.96%。此外,我们开发了一种基于 ColBERT 的零样本检索器,能够检索真实元素,在 Mind2Web 上的召回率为 0.52,在 WebArena 上的召回率为 0.47。