论文

Webscraper:利用多模态大语言模型实现索引-内容式网页抓取

Webscraper: Leverage Multimodal Large Language Models for Index-Content Web Scraping

智能体系统Agent Harness

摘要

现代网页抓取在应对动态、交互式网站时力不从心,这类网站远非静态 HTML 解析所能应付。现有方法往往脆弱,且需要针对每个站点进行人工定制。为解决这一问题,我们提出 Webscraper,一个旨在应对现代动态 Web 应用挑战的框架。它利用多模态大语言模型(MLLM)自主导航交互式界面、调用专用工具,并在传统爬虫失效的环境中进行结构化数据抽取。Webscraper 采用结构化的五阶段提示流程和一套定制工具,对遵循常见“索引-内容”(index-and-content)架构的网站进行导航与数据抽取。在六个新闻网站上开展的实验表明,同时配备我们的引导提示与专用工具的完整 Webscraper 框架,在抽取准确率上显著优于基线智能体 Anthropic 的 Computer Use。我们还将该框架应用于电商平台,以验证其泛化能力。

Webscraper:利用多模态大语言模型实现索引-内容式网页抓取:论文配图
图 1:我们提出的系统架构的概述。代理(计算机使用)接收提示并使用本机环境工具(右上)和我们定制的抓取工具(右下)的组合来执行提取任务并生成结构化数据。