论文
Webscraper:利用多模态大语言模型实现索引-内容式网页抓取
Webscraper: Leverage Multimodal Large Language Models for Index-Content Web Scraping
摘要
现代网页抓取在应对动态、交互式网站时力不从心,这类网站远非静态 HTML 解析所能应付。现有方法往往脆弱,且需要针对每个站点进行人工定制。为解决这一问题,我们提出 Webscraper,一个旨在应对现代动态 Web 应用挑战的框架。它利用多模态大语言模型(MLLM)自主导航交互式界面、调用专用工具,并在传统爬虫失效的环境中进行结构化数据抽取。Webscraper 采用结构化的五阶段提示流程和一套定制工具,对遵循常见“索引-内容”(index-and-content)架构的网站进行导航与数据抽取。在六个新闻网站上开展的实验表明,同时配备我们的引导提示与专用工具的完整 Webscraper 框架,在抽取准确率上显著优于基线智能体 Anthropic 的 Computer Use。我们还将该框架应用于电商平台,以验证其泛化能力。
