论文
WebForge:打破浏览器智能体基准的真实性-可复现性-可扩展性三难困境
WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark
摘要
现有浏览器智能体基准面临一个根本性三难困境:真实网站基准因内容漂移而缺乏可复现性,受控环境因略去真实网络噪声而牺牲真实性,且两者都需要高昂的人工策划成本,限制了可扩展性。我们提出WebForge,首个完全自动化的框架,通过规划(Plan)、生成(Generate)、精炼(Refine)与验证(Validate)四个智能体组成的流水线,端到端地生产可交互、自包含的网络环境,无需人工标注,从而化解这一三难困境。一个七维难度控制框架沿导航深度、视觉复杂度、推理难度等维度组织任务设计,使超越单一聚合分数的系统性能力画像成为可能。利用WebForge,我们构建了WebForge-Bench,一个涵盖7个领域、3个难度级别、共934个任务的基准。多模型实验表明难度分层能有效区分模型能力,而跨领域分析揭示了聚合指标看不到的能力偏向。这些结果共同证实,多维评估能够揭示单一聚合分数无法捕捉的差异化能力画像。代码与基准已在 https://github.com/yuandaxia2001/WebForge 公开。
