论文

PACE:通过代理自动化进行出版商自适应内容提取

PACE: Publisher-Adaptive Content Extraction via Agentic Automation

AI 基础设施数据基础设施

摘要

Web 内容提取对于可靠的 LLM 数据管道至关重要,但现有方法往往难以同时满足准确性、可扩展性和适应性。通用提取器可以广泛应用,但它们对于发布者特定的布局和更丰富的提取目标(例如元数据、图像和表格)通常很脆弱。基于 LLM 的直接提取提供了更大的灵活性,但会产生大量的成本和延迟,而手动设计的特定于发布者的解析器可以实现高精度,但需要大量的人力来构建和维护。我们引入了 PACE,这是一个代理框架,用于从代表性页面和用户需求中学习发布者特定的提取配置。在训练期间,PACE 使用 LLM 来分析页面结构并聚合可重用的提取模式。在推理时,学习到的配置会实例化固定的确定性提取器模板,从而无需额外的 LLM 调用即可实现可扩展提取。涵盖文章正文、元数据和多模式提取的实验表明,PACE 的性能优于可扩展的非手动基线,同时接近手动设计的特定于发布者的解析器的质量。 PACE 实现了对文章文本、元数据、图像和表格的更强大提取,这表明代理配置学习可以自动提取文章文本之外的 LLM 就绪页面表示的发布者特定的提取。