论文
实体对齐的谓词重要性估计和解耦基本原理 - 分数 蒸馏
Predicate Importance Estimation and Decoupled Rationale-Score Distillation for Entity Alignment
摘要
知识图(KG)越来越多地用作 大语言模型(LLM)的结构化上下文,但工业 KG-RAG 系统通常需要集成由异构数据库构建的公共和特定领域的 KG。这种集成依赖于实体对齐(EA),在谓词名称变化和不完整的局部邻域的情况下,单独的词法匹配是不够的。我们通过构建成对 EA 数据集并提出两个互补模块来解决 EA 知识图谱集成问题:谓词重要性估计 (PIE) 和解耦基本原理评分 蒸馏 (DRSD)。 PIE 是一种紧凑的基于嵌入的方法,它从每个 1 跳三元组中删除主题信息,对生成的无主题三元组进行编码,并将它们与可学习的谓词重要性权重聚合以构建谓词感知实体嵌入。 DRSD 使用教师 LLM 通过不同提示生成的伪答案来训练精炼的小语言模型 (SLM)。通过将二进制 EA 标签转换为基于文本的监督,并将置信得分估计与标签一致的基本原理解耦,DRSD 使 SLM 能够学习特定于任务的推理,同时保留较少标签偏差的置信信号。实验表明 PIE 和 DRSD 改进了 EA 分类。此外,由于 DRSD 将置信度评估与决策分离,因此两者之间的差异标志着人工审核的不确定预测,从而导致自动接受和人机交互验证之间存在实际差异。