论文

让失败安全:面向开放网络数据采集的受约束可验证智能体框架

Making Failure Safe: A Constrained, Verifiable Agent Framework for Open-Web Data Collection

智能体系统Agent Harness

摘要

LLM与智能体能从自然语言需求生成网页爬虫——但直接生成仍不可靠——因依赖错误、失效选择器、模式失配与异构页面结构。我们提出受约束、可验证的智能体框架——把LLM输出从自由格式代码转为带类型的JSON采集器配置——组合六类采集器分类法、模板与效用函数约束、静态Airflow DAG执行、基于规则的质量检查与结构化反馈纠正。138任务实验表明该分类法支持基于描述的需求分型——同时确认稳定实例化需要补全超出初始描述的来源、字段与执行约束。在80个独立来源验证的任务上——该框架以零执行阶段LLM token与最低平均墙钟时间运行——以适度的一次性质量换取可复用、确定性、可验证的执行路径——适合重复定时采集。这些结果把该框架定位为重复开放网络数据采集的可复用、低成本、可验证执行路径。