论文

LentEx:通过合成数据和指令调整的可泛化潜在实体提取 LLM

LentEx: Generalizable Latent Entity Extraction via Synthetic Data and Instruction-Tuned LLMs

模型训练合成数据

摘要

潜在实体提取 (LEE) 解决了在自由文本中识别隐式的、根据上下文推断的实体的挑战,这是传统实体提取方法的不足之处。在本文中,我们介绍了 LentEx,这是一种用于潜在实体提取的新型框架,它利用合成数据生成和指令 微调 来优化更小、高效的 大语言模型 (LLM)。潜在实体通常是抽象的和主题的,对于检索增强生成(RAG)、客户角色分析和知识图富集等应用至关重要。 LentEx 通过采用基于模板的方法生成多样化、上下文丰富的合成数据来解决标记数据集的稀缺问题,确保高度可变性并与现实世界的分布保持一致。据我们所知,LentEx 是第一个通过 LLM 的视角系统地接触 LEE 的公司。 LentEx 在多个任务中展示了显着的性能改进,特别是超越了 MTEB 集群基准上最先进的模型。此外,我们的方法能够对未见过的领域进行稳健的泛化,使 LentEx 高度适用于现实世界的 NLP 任务,包括 RAG 和聚类,从而为自然语言处理中的潜在实体理解和提取建立了新的范式。