论文

释放 大语言模型 多表实体匹配的强大功能

Unlocking the Power of Large Language Models for Multi-table Entity Matching

应用与实践结构化分析、预测与决策

摘要

多表实体匹配 (MEM) 通过无需唯一标识符即可跨多个数据源同时识别等效实体,从而解决了双表方法的局限性。然而,依赖于预先训练的语言模型的现有方法很难处理由数值属性变化引起的语义不一致。受大语言模型(LLM)强大的语言理解能力的启发,我们提出了一种基于LLM的新颖的多表实体匹配框架,称为LLM4MEM。具体来说,我们首先提出了一种多风格提示增强型 LLM 属性协调模块来解决语义不一致问题。然后,为了缓解多个数据源带来的实体数量激增所带来的匹配效率问题,我们开发了传递共识嵌入匹配模块来解决实体嵌入和预匹配问题。最后,为了解决匹配过程中实体的噪声问题,我们引入了密度感知修剪模块来优化多表实体匹配的质量。我们在 6 个 MEM 数据集上进行了广泛的实验,结果表明,与基线模型相比,我们的模型在 F1 中平均提高了 5.1%。我们的代码可在 https://github.com/Ymeki/LLM4MEM 获取。