论文
使用 大语言模型 标记实体匹配的训练数据
Labeling Training Data for Entity Matching Using Large Language Models
摘要
最近的 大语言模型 (LLM) 在实体匹配方面取得了强大的性能,而无需特定于任务的训练数据。然而,将这些模型应用于大量候选对仍然缓慢且成本高昂。相比之下,使用传统机器学习方法或小语言模型 (SLM)(例如 RoBERTa)的实体匹配器提供更快的推理速度,但需要特定于任务的训练数据。本文研究了是否可以通过使用知识 蒸馏 工作流程来避免提供特定于任务的训练数据的需要,其中 LLM 充当教师模型来标记随后用于训练较小学生模型的训练对。我们从以下几个维度研究实体匹配的 知识蒸馏:配对选择策略、教师模型、标签后处理方法和学生模型。我们使用 Abt-Buy、Walmart-Amazon、WDC Products、DBLP-ACM 和 DBLP-Scholar 基准评估工作流程,并将使用机器标记数据训练的学生模型的性能与使用基准训练集训练的相同模型的性能进行比较。我们的实验表明,使用机器标记集训练的学生模型的表现与在基准训练集上训练的模型大致相当,两个方向上的剩余差异保持在两个 F1 点以下。使用 GPT-5.2 标记所有五个基准的训练集成本为 28.31 美元到 40.88 美元,而手动标记相同的训练集预计需要 470 个小时的工作。在推理时,Ditto 比直接使用 LLM 执行匹配任务快 41.5 至 534 倍。这些结果表明,当前的 LLM 与合适的配对选择方法结合使用时,可以大大减少甚至消除为实体匹配标记用例特定训练数据所需的手动工作。