论文
SchemaRAG:LLM 驱动的结构化信息提取的动态大模式缩减
SchemaRAG: Dynamic Large Schema Reduction for LLM-driven Structured Information Extraction
摘要
当目标模式庞大且复杂时,使用 大语言模型 (LLM) 从非结构化文本中提取结构化数据变得具有挑战性。在这种情况下,在提示中包含完整架构会增加成本和延迟,存在中间丢失性能下降的风险,并且可能超出上下文长度限制。我们提出了 SchemaRAG,这是一种检索增强生成(RAG)框架,它通过利用模式元数据和可用的少量示例,动态修剪用于模式条件信息提取任务的输出模式空间。我们在现实世界的医疗保健和电子商务数据集上评估 SchemaRAG。我们的结果表明,SchemaRAG 可以实现 micro-F1 提高高达 8.8%、延迟降低 47%、词元成本降低 48%,证明了其对于大型模式提取的实用性。