论文

Co-Scraper:查询感知DOM裁剪与可复用抓取程序生成

Co-Scraper: query-aware DOM Pruning and Reusable Scraper Synthesis for Lightweight Web Data Extraction

上下文与知识上下文工程

摘要

Web 内容的丰富性和异构性使得自动化信息提取成为必要,而生成可在类似网页中重复使用的抓取工具为可扩展的数据提取提供了有效的解决方案。在这项工作中,我们提出了 Co-Scraper,这是一个两阶段框架,能够处理长 HTML 文档的层次复杂性。通过将查询感知的 DOM 修剪机制与稳定的提取策略归纳相集成,Co-Scraper 可以使用微调的 Qwen3-8B 模型有效地将 Web 内容转换为可执行的编程包装器。在SWDE的测试集上,Co-Scraper取得了最先进的性能,F1分数为94.78%,复用成功率为90.39%。该框架显着提高了数据提取的准确性和弹性,为 Web 数据采集任务提供了高效的方法。