论文

TimeWarp:通过重访过去评估Web Agent

TimeWarp: Evaluating Web Agents by Revisiting the Past

智能体系统Agent任务评测

摘要

网络代理在当前基准上的改进提出了一个问题:当网络发生变化时,今天的代理是否表现得同样好?我们推出了 TimeWarp,这是一个使用 UI、设计和布局各异的容器化环境来模拟不断发展的 Web 的基准测试。 TimeWarp 由三个 Web 环境组成,每个环境都有六个跨越互联网不同时代的 UI 版本,并配有一组需要不同形式的 Web 导航的复杂、现实的任务。我们的实验揭示了网络代理对变化的脆弱性以及单版本轨迹上行为克隆(BC)的局限性。为了解决这个问题,我们提出了 TimeTraj,这是一种简单而有效的算法,它使用计划蒸馏来收集跨多个版本的轨迹。通过使用我们的 BC 变体训练代理进行教师部署,我们取得了显着的性能提升:Qwen-3 4B 模型为 $20.4\%\rightarrow37.7\%$,Llama-3.1 8B 模型为 $0\%\rightarrow27.0\%$。我们希望我们的工作能够帮助研究人员研究网页设计的泛化,并解锁收集计划而不是轨迹的新范式,从而提高网络代理的稳健性。