论文

Guardian Crawler:利用有界 LLM 增强的嘈杂 Web 智能进行检索优先的知识发现

Guardian Crawler: Retrieval-First Knowledge Discovery with Bounded LLM Augmentation for Noisy Web Intelligence

上下文与知识检索增强

摘要

从嘈杂的网络数据中检索相关证据具有挑战性,特别是在包含不完整报告、异构语言和不相关内容的敏感领域。我们推出了 Guardian Crawler,这是一个可重复的检索优先测试平台,用于在合成的网络状语料库上进行知识发现和基于证据的总结的受控实验。该架构将 BM25 检索与风险感知、嵌入增强和混合重新排名相结合,然后是具有显式文档引用的约束检索增强生成。在基于风险的重新排序下,对合成的 900 个文档语料库和 10 个查询进行的实验产生了最高的描述性检索得分,P@10 = 1.00 和 NDCG@10 = 0.94,而 BM25 的得分为 0.94 和 0.81。最佳混合配置和 BM25+Semantic 配置的 NDCG@10 值分别为 0.94 和 0.88。所有 41 个可评估的生成项目符号均通过了词汇覆盖率阈值;自动 LLM 判断将 36 个分类为受支持,1 个分类为部分支持,4 个分类为不支持。这些结果证明了 Guardian Crawler 作为受控测试平台的可行性,但并未建立统计优势、人工验证的 忠实性 或转移到实时网络调查环境。