论文
先结构后查询:对非结构化文档进行精确的分析查询
Structure then Query: Enabling Precise Analytical Queries over Unstructured Documents
摘要
非结构化文档构成了企业和网络数据的大部分。随着大语言模型(LLM)的快速发展,研究人员开始构建像操作数据库一样分析非结构化文本文档的数据系统。然而,由于主流检索方法仍然依赖于基于向量相似度的模糊匹配,准确获取信息并进行结构化分析和推理仍然是一大挑战。为了解决这些限制,AnnoIndex 引入了两个核心基本组件。第一个是注释索引。该系统使用一个名为 SchemaLoop 的模块从原始语料库自动创建分层注释模式,然后使用轻量级语言模型提取特定值。它将分散的非结构化文本转变为物化的结构化索引,从而实现低成本的过滤和查询。注释索引避免了向量相似度的黑盒匹配,并将属性提取成本从在线查询分摊到一次性构建。第二个创新是结构化查询引擎。它根据SQL扩展将用户问题编译成执行计划。它首先使用注释索引进行精确的文档过滤,然后按成本升序逐渐应用提取操作,仅对语料库中需要深入语义理解的剩余最小部分使用 LLM。将提取的属性合并到注释索引中,减少以后查询的成本。对三个真实世界数据集的实验表明,AnnoIndex 始终优于最先进的基线,实现了最高的平均 F1 分数 (0.87),同时在复杂的多跳连接和渐进推理查询上保持稳健的性能。